エージェントに自分自身の「使い方」を進化させたら、賢くなったふりをしてただけだった…そんな過学習問題に切り込む論文です。
タイトル: RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
URL:
❓ ハーネスって何?
プロンプトや制御フロー、ツール、メモリ管理など、LLM本体を取り巻く「使い方の設計」全体のことです。同じモデルでもハーネス次第で性能が大きく変わります。
❓ なぜ自己改善させると過学習するの?
進化に使った評価タスクだけに合わせ込む・ノイズに過剰反応する・変更が際限なく複雑化する、という3つの失敗モードがあるからです。
💡 RRSIはどう解決するの?
古典的な機械学習の正則化(L0・L1・L2)をハーネス進化に応用。編集数に予算制約をかけ、ベンチマーク特化の変更案は選択段階で弾き、成果の出ないコンポーネントは枝刈りします。
💡 効果はどれくらい?
8ベンチマークで評価した結果、未知のタスクでも最大22.9%の性能向上を確認。しかもトークン使用量は30%削減されました。
自己改善するAIエージェントを実運用に近づける、地に足のついた一歩だと感じます。
#
AIエージェント# #
自己改善#