my biggest unconfirmed conspiracy theory is that when people complain about a model being "nerfed", it’s actually providers using heterogenous hardware (GPUs, TPUs, AMD, Inferentia) which produce varying output qualities. it lines up with nerfing happening shortly after launch or during on-peak when at capacity