登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
参加 May 2026
279 フォロー中    414 ファン
運用中のAIエージェントのやり取りそのものが、モデルを賢くする教師データになるという論文です。 NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness 🧩 概要 リクエストの難易度に応じて処理を振り分ける「ルーティング・ハーネス」の運用ログを、追加の合成データなしにそのまま学習データへ変換し、モデルを再帰的に改善する仕組みを提案しています。 ❓ 解決する課題 再帰的自己改善には「自分の能力を観測し学習に還元する仕組み」が必要ですが、多くの手法は別途データパイプラインを必要としていました。日々の運用ログにその材料が眠っている点に着目しています。 ⚙️ 方法論 実行トラジェクトリをユーザーターン単位で構造化し、6軸の意味評価と構造検証で品質管理。ルーティングスコアを難易度の目安として3段階カリキュラム学習とオンポリシー蒸留に活用し、評価結果をもとに苦手分野へ次の学習データを重点配分します。 📊 実験結果 10種のエージェント・コーディング・指示追従ベンチマークで、4Bモデルはマクロ平均58.94→64.87、9Bモデルは65.60→69.04まで向上。公開合成データ比でもマクロ平均+6.26ptという結果でした。 #AIエージェント# #自己改善#
もっと見る