TL;DR: Issueやコミット履歴を使わず「ソースコードそのもの」だけから、コーディングエージェント用のRL訓練タスクを5,545件も自動生成するパイプラインが登場しました。しかも量より質を優先した設計です。
タイトル: CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
URL:
ポイント
🏗️ 3,185リポジトリ・23言語・15ドメインから5,545タスクを自動構築
🧪 リファレンス実装を実行して期待値を記録する「実行に基づくテスト」で検証器を自動生成
🛡️ リーク検査・解答一致確認・難易度フィルタの3段構えで環境の質を保証
📈 DeepSWEで+11.7pt、ProgramBenchで+17.0pt、Terminal-Benchで+8.5ptと大幅改善
🔍 フィルタ済み5kタスクがフィルタなし8kタスクを一貫して上回り「質が量に勝る」ことを実証
🧠 訓練後は探索・自己検証の頻度が増加し、外部ベンチマークにもその挙動が転移
開発履歴がなくても、コードさえあればRL訓練環境を作れるという発想がシンプルで実用的だと感じました。
#
CodingAgent# #
強化学習#