刚刷到这个发布,第一反应就是:35B 开源权重 + 本地可跑的 Agent Team,这配置也太对胃口了。
同一套权重,ReAct 跑到 40,Agent Team 直接干到 50.2(金融)和 51.7(科研),这个差距还是挺夸张的。
这也让我更明显地感觉到,复杂任务里,真正拉开差距的可能已经不只是“模型有多大”,而是 harness 怎么设计、验证机制怎么做。
尤其是把 Independent Statement Review 直接塞进执行循环里,而不是等任务全部跑完了再去检查一遍,我觉得这个思路挺务实。
复杂任务最怕的其实不是模型不会做,而是做到一半跑偏了,最后还一本正经地给你一个没法核验的结论。
把 review 和验证直接嵌进流程,相当于边跑边纠偏,这个设计确实有点东西。
准备今晚就拉下来玩玩。
顯示更多