登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
参加 May 2026
279 フォロー中    408 ファン
SWEエージェントを全タスク一括で強化学習すると、あるカテゴリが伸びる裏で別のカテゴリがこっそり劣化する。そんな「シーソー問題」に切り込んだ研究です。 タイトル: One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents URL: ❓ カテゴリのシーソー問題とは何ですか? 全タスクをプールして単一ポリシーでRL学習すると、全体スコアは上がって見えても、実は特定のカテゴリだけが犠牲になっていることがあります。全体指標だけではこの綱引きが見えません。 ❓ どうやって解決するのですか? タスクをエビデンスに基づく分類体系でカテゴリ分けし、カテゴリごとに専門のエキスパートモデルを育てます。育成にはRefresh(再評価)・Repair(成功例で修復)・Expand(学習対象を拡張)を繰り返すRREループを使います。 ❓ 複数のエキスパートはどう1つにまとめるのですか? ラベルルーティング型のマルチ教師オンポリシー蒸留(MOPD)で、タスクのラベルに応じて適切なエキスパートの知識だけを生徒モデルに転送し、単一のデプロイ可能なモデルに統合します。 ❓ 効果はどれくらいありますか? Pro-618で58.04%(ベース比+5.39ポイント)、SWE-bench Multilingualで59.00%(+2.78ポイント)を達成し、カテゴリ間の性能もより均衡しました。 #SWEエージェント# #強化学習#
もっと見る
Alibaba releases a new training framework for software engineering agents It develops category experts via iterative Refresh–Repair–Expand (RRE) and consolidates them into one deployable model with label-routed multi-teacher distillation (MOPD). Achieves 58.04% on Pro-618 and 59.00% on SWE-bench Multilingual.
もっと見る