가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
가입 May 2026
280 팔로잉 중    421 팬
TL;DR 自分で問題を作り自分で答える自己進化型エージェントは、出題者と解答者が同じ間違いで「意気投合」してしまう「共食い」に陥ります。出典を分割して評価する手法でこれを防ぎ、性能を8ポイント以上改善しました。 タイトル: False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents URL: ポイント 🔁 出題者と解答者が同じ出典由来の誤りを共有し、偽の一致が報酬として循環する「共食い」を発見 📉 標準的なDr. Zeroでは偽の一致が6.1%・8.8%発生 ✂️ 出典を2つのフォールドに分割し、互いに相手側で学習した補助解答者が採点するCrossFitを提案 📊 CrossFit単独で偽の一致を3.0%・3.7%に、MSVと併用すると2.0%・1.7%まで削減 🚀 下流タスクの平均Cover-EMはDr. Zero比で8.8・8.4ポイント向上 🧩 マルチホップタスクほど改善幅が大きく、平均10ポイント以上の効果 💰 計算コストはベースラインの1.72〜2.7倍増加するが、半予算の変種でも効果を確認 評価者自身の学習履歴まで監査しないと、見かけの進歩に騙されるという指摘が印象的です。 #自己進化エージェント# #強化学習#
더 보기