SWEエージェントを全タスク一括で強化学習すると、あるカテゴリが伸びる裏で別のカテゴリがこっそり劣化する。そんな「シーソー問題」に切り込んだ研究です。
タイトル: One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
URL:
❓ カテゴリのシーソー問題とは何ですか?
全タスクをプールして単一ポリシーでRL学習すると、全体スコアは上がって見えても、実は特定のカテゴリだけが犠牲になっていることがあります。全体指標だけではこの綱引きが見えません。
❓ どうやって解決するのですか?
タスクをエビデンスに基づく分類体系でカテゴリ分けし、カテゴリごとに専門のエキスパートモデルを育てます。育成にはRefresh(再評価)・Repair(成功例で修復)・Expand(学習対象を拡張)を繰り返すRREループを使います。
❓ 複数のエキスパートはどう1つにまとめるのですか?
ラベルルーティング型のマルチ教師オンポリシー蒸留(MOPD)で、タスクのラベルに応じて適切なエキスパートの知識だけを生徒モデルに転送し、単一のデプロイ可能なモデルに統合します。
❓ 効果はどれくらいありますか?
Pro-618で58.04%(ベース比+5.39ポイント)、SWE-bench Multilingualで59.00%(+2.78ポイント)を達成し、カテゴリ間の性能もより均衡しました。
#
SWEエージェント# #
強化学習#