運用中のAIエージェントのやり取りそのものが、モデルを賢くする教師データになるという論文です。
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
🧩 概要
リクエストの難易度に応じて処理を振り分ける「ルーティング・ハーネス」の運用ログを、追加の合成データなしにそのまま学習データへ変換し、モデルを再帰的に改善する仕組みを提案しています。
❓ 解決する課題
再帰的自己改善には「自分の能力を観測し学習に還元する仕組み」が必要ですが、多くの手法は別途データパイプラインを必要としていました。日々の運用ログにその材料が眠っている点に着目しています。
⚙️ 方法論
実行トラジェクトリをユーザーターン単位で構造化し、6軸の意味評価と構造検証で品質管理。ルーティングスコアを難易度の目安として3段階カリキュラム学習とオンポリシー蒸留に活用し、評価結果をもとに苦手分野へ次の学習データを重点配分します。
📊 実験結果
10種のエージェント・コーディング・指示追従ベンチマークで、4Bモデルはマクロ平均58.94→64.87、9Bモデルは65.60→69.04まで向上。公開合成データ比でもマクロ平均+6.26ptという結果でした。
#
AIエージェント# #
自己改善#