这个博客讲 Agent Harness 自进化中比较重要的一个问题:
Harness 跑分提高了,到底哪里真的变好了?
作者提出 Harness-Delta Attribution,把一次提升拆成三部分:过拟合、更多 test-time compute,以及最后真正能泛化的改进。
结果是在 ALFWorld 和 LiveMath 上,大量提升其实来自 Harness 学会了数据集里的规律和 shortcut;CREATE 上,不少收益单纯增加模型调用次数就能拿回来。
到了 held-out test,16 组实验里甚至有 4 组进化后的 Harness 比原来的 baseline 更差。
SWE-bench 上能看到比较明显的可泛化提升,但主要集中在能力较弱、还有提升空间的模型。
我觉得这对 Agent 自进化研究有一个提醒。
以后看到「Harness 自动进化后 +20%」,需要多问一步:这 20% 里有多少学到了可复用的方法,有多少只是记住 Benchmark,或者花了更多 Token 和调用次数。
文章:
显示更多