Register and share your invite link to earn from video plays and referrals.

Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
Joined November 2020
625 Following    12.3K Followers
现在新模型出得这么快,每个人都应该有一套自己的 AI Benchmark。 Every 这家公司最近就在给每个员工做这件事。 方法其实很简单:把你平时最常交给 AI 的几个真实任务留下来,再把每次「这里不对」「这个我会改掉」慢慢变成可检查的规则。 久而久之,你就有了一套只属于自己的 Eval。 很有意思的是,他们内部测试里,GPT-5.6 Luna 在某些人的真实工作上,甚至比更强的模型表现更好。 我觉得这件事以后会很重要。 Benchmark 不应该只回答「哪个模型最强」,还应该回答「哪个模型最适合替我做这件事」。 甚至再往前一步,你每天修改 AI 的那些地方,其实都在暴露自己的判断标准。 如果能把这些判断慢慢沉淀成 Eval,AI 才真的开始学会「什么叫对你来说做得好」。 文章:
Show more