註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

吾日三省
@lb1800
Always curious. Love research. Cherish family. Enjoy sharing.
加入 April 2014
725 正在關注    21.4K 粉絲
刚刷到这个发布,第一反应就是:35B 开源权重 + 本地可跑的 Agent Team,这配置也太对胃口了。 同一套权重,ReAct 跑到 40,Agent Team 直接干到 50.2(金融)和 51.7(科研),这个差距还是挺夸张的。 这也让我更明显地感觉到,复杂任务里,真正拉开差距的可能已经不只是“模型有多大”,而是 harness 怎么设计、验证机制怎么做。 尤其是把 Independent Statement Review 直接塞进执行循环里,而不是等任务全部跑完了再去检查一遍,我觉得这个思路挺务实。 复杂任务最怕的其实不是模型不会做,而是做到一半跑偏了,最后还一本正经地给你一个没法核验的结论。 把 review 和验证直接嵌进流程,相当于边跑边纠偏,这个设计确实有点东西。 准备今晚就拉下来玩玩。
顯示更多