TL;DR: エージェントが失敗するのはモデルの賢さ不足ではなく「実行を取り巻く仕組み」の欠陥。重みを触らず実行環境だけを鍛える「ハーネススケーリング」で、Terminal-Bench 2.1に95.3%・約$15で到達しました。
タイトル: StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
URL:
ポイント
🧠 モデルではなくハーネスを拡張。再訓練なしで失敗から学習させる新パラダイム
📌 永続状態でエピソードをまたいで発見を保持
🎯 フェーズ局所の文脈で意思決定点に関連情報だけを提示
✅ 検査付き遷移で事前条件を検証し連鎖失敗を防止
📖 回復可能ランブックで失敗を照会可能な知識として再利用
🕒 バージョン管理された手順で戦略を更新・ロールバック
💰 GPT-5.6が95.3%(445試行/全89タスク成功)、$574.68の実行を約$15に圧縮
失敗を毎回「実行可能な事前条件」に変え、信頼性を運用基盤から底上げする一本です。
#
AIAgents# #
TerminalBench#