Register and share your invite link to earn from video plays and referrals.

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
Joined May 2026
280 Following    415 Followers
🎯 長時間タスクでエージェントが下す判断の「センスの良さ」を、専門家のアノテーションなしで測る方法が提案されました。 タイトル: The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks URL: 📖 概要 エージェントが長時間タスクの途中で下す判断(どの仮説を試すか、どの実装を土台にするか)を評価するベンチマーク Taste-Bench(502問)を構築した研究です。さらに、この判断力は蒸留で学習可能であることも示しています。 🔥 解決する課題 既存のベンチマークはタスクをやり切れたかどうかしか測っておらず、途中の判断の質を評価できません。しかも誤った判断はその時点では妥当に見え、コストが表面化するのは予算を使い切った後です。人手で採点するには深いドメイン専門性が必要でスケールしません。 🧪 方法論 軌跡の後半が前半の判断に対する事後的な証拠になる、という着想が鍵です。 ・同一タスクへの複数試行が分岐し片方だけ成功した地点(エージェントが最後まで気づかなかった誤り) ・1本の軌跡内でエージェントが失敗して立て直した地点(自己修正した誤り) この2種類の分岐点を自動採掘し、分岐後を隠して2択問題にします。選択肢の並び順を反転させた2回とも正解した場合のみ正解とするため、ランダム推測は25%になります。 📊 実験結果 ・14モデルを評価し、最高は GPT-5.6 Sol の59.7%。2択なのに天井には程遠い水準です ・決定的な証拠が遠い先にあるほど急落し、最遠では21.0%とランダム以下になります ・推論予算を最大まで上げても改善は −0.2〜+2.2ポイントにとどまりました ・SWE-bench Verified との相関は r=0.63 どまりで、同スコア帯でも10.7ポイント差が出ます ・蒸留した生徒の助言を注入すると、実タスク成功率が14.6%から33.7%へ向上しました #AIエージェント# #ベンチマーク#
Show more