AIエージェントの性能はモデルだけで決まらない——ハーネスの設計次第で大きく変わります。
TL;DR
JIT-Agentはタスクの特性に応じてエージェントハーネス(スキャフォールド)をジャストインタイムで自動生成・修復・進化させる専用モデルです。GLM-5.2で+7.7pt、DeepSeek-V4-Flashで+8.8ptの平均向上を達成し、9ベンチマーク中8つでGPT-5.6を含む全フロンティアモデルを上回りました。
タイトル: Scaling Harness Intelligence via Just-in-Time Harness Evolution
URL:
ポイント
🧩 ハーネスを「学習可能なアーティファクト」として定式化
メモリ・計画・アクション・能力オーケストレーションの4モジュールプロトコル h = (M, P, A, F) でハーネスを形式化。生成空間を制約しつつ13種類の既存ハーネスを全て表現できる設計です。
🎓 教師あり→修復→進化の3段階訓練
ステージIで教師生成ハーネスを学習、ステージIIで実行失敗時の修復を学習(最大2反復)、ステージIIIのEvo-GDPOでパレートフロンティアを前進させる新規ハーネスを進化的に探索します。
📊 精度向上とコスト削減を同時達成
xBench-DeepSearchでスコア78→82(+4pt)の一方、トークン消費は527K→212K(▲60%)、コストは$0.075→$0.039(▲48%)。9ベンチマーク平均で固定ハーネス比36%のトークン削減を実現しています。
⚡ 複数モデルファミリーに転移可能
JIT生成ハーネスはDeepSeek V4(+10.2pt平均)、Mimo V2.5(+8.6pt)、Qwen 3.6(+4.0pt)でいずれもReActを上回り、ハーネス生成器を再訓練せずに転移できます。
🔄 ストリーミングモードで運用中も進化
デプロイ後もタスクシーケンスをまたいでハーネスを蓄積・更新する「オンライン進化」を実装。静的生成より全評価ベンチマークで上回ります。
ベースモデルのスケーリングと独立した「ハーネス知性」という新たなスケーリング軸の提案として注目です。
#
AIエージェント# #
LLMスケーリング#