TL;DR 自分で問題を作り自分で答える自己進化型エージェントは、出題者と解答者が同じ間違いで「意気投合」してしまう「共食い」に陥ります。出典を分割して評価する手法でこれを防ぎ、性能を8ポイント以上改善しました。
タイトル: False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents
URL:
ポイント
🔁 出題者と解答者が同じ出典由来の誤りを共有し、偽の一致が報酬として循環する「共食い」を発見
📉 標準的なDr. Zeroでは偽の一致が6.1%・8.8%発生
✂️ 出典を2つのフォールドに分割し、互いに相手側で学習した補助解答者が採点するCrossFitを提案
📊 CrossFit単独で偽の一致を3.0%・3.7%に、MSVと併用すると2.0%・1.7%まで削減
🚀 下流タスクの平均Cover-EMはDr. Zero比で8.8・8.4ポイント向上
🧩 マルチホップタスクほど改善幅が大きく、平均10ポイント以上の効果
💰 計算コストはベースラインの1.72〜2.7倍増加するが、半予算の変種でも効果を確認
評価者自身の学習履歴まで監査しないと、見かけの進歩に騙されるという指摘が印象的です。
#
自己進化エージェント# #
強化学習#