コーディングエージェントの「ハーネス」って、計画機能もツール設計も文脈管理も、実はモデルの強さ次第で最適解が真逆になるんです。176通りの実験でそれを丁寧に検証した論文です。
タイトル: An Empirical Study of Harness Design for Coding Agents
URL:
🧠 注目ポイント1: 文脈管理は資源が少ないほど効く
32kトークンのウィンドウでは、文脈管理ありと管理なしでSWE-Benchの成功率差が35.7ポイントにも達しました。しかも複雑なリコール機構はほぼ使われず、精度にも寄与しないことが判明しています。
📋 注目ポイント2: 計画機能の効果はモデルの強さで真逆になる
弱いモデル(30B)は計画を与えると成功率が+11.6ポイント向上しました。編集を試さず終了してしまう割合も69%から28%に激減しています。逆に強いモデル(550B)は計画なしでも十分で、計画を入れるとコストが約30%下がりました。
🔧 注目ポイント3: ツール設計もモデル・タスク次第
弱いモデルは専用ツール一式が必要ですが、強いモデルはbashコマンドだけの方が高性能かつ低コストになるケースが目立ちました。同じモデルでもタスクの種類によって最適解が逆転することもあります。
自分たちのモデルとタスクに合わせて、ハーネスの各要素を個別にチューニングする発想が大事だと実感しました。
#
コーディングエージェント# #
LLM#