🧭 TL;DR: LLMの「自信」を今この瞬間の推論だけで決めるのをやめ、過去の似た経験からどれくらい当たってきたかで較正する手法が登場しました。10サンプルの自己整合性より安く、しかも精度は同等以上です。
タイトル: Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents
URL:
ポイント
🗂 過去のタスク・推論・当初の確信度・実際の正誤・教訓を経験バンクに蓄積
🔍 類似エピソードをk=50件検索し実際の的中率を統計的に把握(Recall)
💭 その実績を踏まえてモデル自身に確信度を言葉で再表明させる(Reflect)
🏆 24モデル×データセットの組み合わせ中23でSC
@10と同等以上のAUROC
🤖 失敗が静かに起きがちなエージェントタスクで最大の差、AppWorldでは専用検証器すら上回る
📉 キャリブレーション誤差はドメイン全体で2〜20倍改善、計算コストは約10分の1
「今の推論だけ見る」から「積み重ねた実績を見る」への発想転換が効いている好例だと思います。
#
LLM評価# #
AIエージェント#