註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
加入 November 2020
600 正在關注    11.4K 粉絲
这个博客讲 Agent Harness 自进化中比较重要的一个问题: Harness 跑分提高了,到底哪里真的变好了? 作者提出 Harness-Delta Attribution,把一次提升拆成三部分:过拟合、更多 test-time compute,以及最后真正能泛化的改进。 结果是在 ALFWorld 和 LiveMath 上,大量提升其实来自 Harness 学会了数据集里的规律和 shortcut;CREATE 上,不少收益单纯增加模型调用次数就能拿回来。 到了 held-out test,16 组实验里甚至有 4 组进化后的 Harness 比原来的 baseline 更差。 SWE-bench 上能看到比较明显的可泛化提升,但主要集中在能力较弱、还有提升空间的模型。 我觉得这对 Agent 自进化研究有一个提醒。 以后看到「Harness 自动进化后 +20%」,需要多问一步:这 20% 里有多少学到了可复用的方法,有多少只是记住 Benchmark,或者花了更多 Token 和调用次数。 文章:
顯示更多
0
22
101
18
轉發到社區