🤖 AIエージェントは、自分自身が動くための「実行基盤」を自分で作って改善できるのでしょうか。
タイトル: HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
URL:
❓ そもそも「ハーネス」とは何ですか
💡 実行ループ・ツール利用・コンテキスト管理・失敗からの復旧・検証など、エージェントを動かす実行基盤のことです。これまでの評価はハーネスを固定してモデル性能だけを測ってきましたが、実際はハーネスの設計品質も実力を大きく左右します。
❓ LLMは最小限の材料からハーネスを作れますか
💡 わざと弱いシードハーネスから構築させたところ、最高スコアのOpus 4.8でも67.8点にとどまり、人間が作った参照実装(86.2点)には及びませんでした。特にリサーチ・検索領域でのギャップが最も大きかったです。
❓ 自分でハーネスを改善(進化)させることはできますか
💡 5つのモデルすべてが可視フィードバック上では改善しましたが、隠されたタスクでの改善幅は大幅に縮小。バージョン切り替えの64回中、ノイズを超える明確な改善は2回だけでした。
❓ 別の実行者モデルに載せ替えても性能は保たれますか
💡 保たれないケースが目立ちました。Opusが作ったハーネスは実行者をGeminiに固定した途端、SWE-Proスコアが69.3から33.0に急落。ハーネスは特定モデルの前提を埋め込んでしまうため、移植性には注意が必要です。
#
AIエージェント# #
LLM#