One would assume this would be easy since you could rerun the same evals from release day.
Has anyone ever produced any proof that ANY frontier AI provider has "nerfed" a model after release? Everyone repeats it and I'm trying to steelman it first before I attribute it to psychological phenomena.
1 comment
[ 0.30 ms ] story [ 6.8 ms ] threadHas anyone ever produced any proof that ANY frontier AI provider has "nerfed" a model after release? Everyone repeats it and I'm trying to steelman it first before I attribute it to psychological phenomena.