登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
参加 May 2026
279 フォロー中    412 ファン
TL;DR: エージェントが失敗するのはモデルの賢さ不足ではなく「実行を取り巻く仕組み」の欠陥。重みを触らず実行環境だけを鍛える「ハーネススケーリング」で、Terminal-Bench 2.1に95.3%・約$15で到達しました。 タイトル: StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling URL: ポイント 🧠 モデルではなくハーネスを拡張。再訓練なしで失敗から学習させる新パラダイム 📌 永続状態でエピソードをまたいで発見を保持 🎯 フェーズ局所の文脈で意思決定点に関連情報だけを提示 ✅ 検査付き遷移で事前条件を検証し連鎖失敗を防止 📖 回復可能ランブックで失敗を照会可能な知識として再利用 🕒 バージョン管理された手順で戦略を更新・ロールバック 💰 GPT-5.6が95.3%(445試行/全89タスク成功)、$574.68の実行を約$15に圧縮 失敗を毎回「実行可能な事前条件」に変え、信頼性を運用基盤から底上げする一本です。 #AIAgents# #TerminalBench#
もっと見る