ハーネスを自動最適化する手法は増えていますが、どのシナリオで学習するかは最初に固定されたまま。この「カリキュラム」自体を動かす発想が登場です。
タイトル: ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization
URL:
📝 概要
エージェントハーネスの自動最適化において、学習に使うシナリオの選択自体を「自動カリキュラム学習問題」として定式化し、最適化の進行とともに動的に適応させる手法ActiveSaddlerを提案しています。
❗ 解決する課題
固定されたシナリオ順では、未解決の弱点を早々に見捨てたり、すでに修復済みの課題へロールアウトを浪費したりしてしまいます。既知の弱点を再訪する価値と新たな失敗を探索する価値のバランスも最適化中に変化しますが、静的なスケジュールでは対応できません。
🛠️ 方法論・提案手法
カリキュラム選択を「動的にインスタンス化されるアームを持つ非定常バンディット」としてモデル化。個々のシナリオではなく「失敗パターン」をアームとし、LLMベースの優先順位付け器が深刻度・修正可能性・波及範囲・副作用リスクの4要因から学習ポテンシャルを毎イテレーション再計算。既知の弱点を活用するか未見のシナリオを探索するかを、残存する実行可能な弱点の有無に応じて適応的に判断します。
📊 実験結果
GAIA2でPass
@1が59.8%(固定ランダム順比+4.4ポイント)、Terminal-Bench 2.0で80.0%(+7.5ポイント)を達成。コスト効率も優れ、GAIA2では298ドルで他手法が1,360ドルかけて届く精度に到達しました。
#
エージェント最適化# #
カリキュラム学習#