现在新模型出得这么快,每个人都应该有一套自己的 AI Benchmark。
Every 这家公司最近就在给每个员工做这件事。
方法其实很简单:把你平时最常交给 AI 的几个真实任务留下来,再把每次「这里不对」「这个我会改掉」慢慢变成可检查的规则。
久而久之,你就有了一套只属于自己的 Eval。
很有意思的是,他们内部测试里,GPT-5.6 Luna 在某些人的真实工作上,甚至比更强的模型表现更好。
我觉得这件事以后会很重要。
Benchmark 不应该只回答「哪个模型最强」,还应该回答「哪个模型最适合替我做这件事」。
甚至再往前一步,你每天修改 AI 的那些地方,其实都在暴露自己的判断标准。
如果能把这些判断慢慢沉淀成 Eval,AI 才真的开始学会「什么叫对你来说做得好」。
文章:
顯示更多