💰 同じモデルなのに、包むソフトウェア(ハーネス)を変えるだけでコストが5倍変わる。でも成功率はほぼ同じ。そんな結果が出ました。
タイトル: HarnessTax: How Much Does the Harness Matter for Coding Agents?
URL:
UC BerkeleyとArenaが、Claude Code・Codex CLI・Piという3つのコーディングエージェント用ハーネスを、7モデル・21のモデル-ハーネスペアで比較しました。注目ポイントを3つ紹介します。
📊 成功率への影響は統計的にほぼゼロ
モデル内でのハーネス比較42件のうち、統計的に有意だったのはわずか1件(偶然の水準は約2件)。多重比較補正後は有意な差は1件も残りませんでした。
💸 コストは同じ成功率で最大5倍差
GPT-5.6 Lunaでは、Claude Codeが1タスク0.15ドル・成功率55.6%、Piが0.03ドル・成功率53.3%と、成功率はほぼ同じでもコストは5倍違いました。
🪶 最小構成のオープンソースハーネスPiが十分強い
12件のモデル比較のうち9件で、ベンダー製ではないハーネスが最高の成功率を記録し、シンプルなハーネスでも十分戦えることが示されました。
派手な機能より、まずコストと信頼性を見るべきという実用的な結論だと思います。
#
コーディングエージェント# #
LLMコスト最適化#