🔁 キャビネットを34回調べ続けて50ステップで力尽きたエージェントが、同じタスクを17ステップで解けるようになりました。
タイトル: Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States
URL:
履歴を保持したり圧縮したりするのではなく、「今の世界はこうなっている」という信念を明示的に持ち続けることで長時間タスクを安定させる、学習不要の推論時フレームワークPoSの提案です。
注目ポイントは3つあります。
🗂 信念を構造として持つ
世界状態をEntity・State・Relationの構造で表し、各状態には出所と確信度、可能なら裏づけの証拠まで添えます。環境を網羅的にモデル化せず、行動の実行可能性や目標の充足に効く記録だけを残すのがポイントです。あわせて「まだ知るべきこと」と「まだ達成すべきこと」をギャップとして明示します。
🐞 毎ステップ、信念を検証する
Belief Sentinelという検証器が、更新された信念に矛盾がないか、観測やこれまでの証拠と食い違っていないかを毎回チェックし、確定前に修正させます。電子レンジが開と閉の両方で記録されると、マグを入れる前に開けるべきか判断できなくなる、という類の破綻を防ぐ役割です。
🚨 空回りを検知して脱出する
進捗が出ないまま行動し続ける状態をBelief Trappingと呼び、未解決ギャップの残存率・進捗のない遷移の割合・同じ状態の再訪頻度の3指標で検知します。そのうえで挙動パターン(静止・循環・漂流)と詰まっているギャップの種別に分けて診断し、両方に合わせた復旧制約をかけます。
4ベンチマーク・3バックボーンすべてで最高性能を記録し、RCA-100では最強ベースラインを相対37.89%上回りました。総トークンは5倍に増えますが、タスクエージェント自身の消費は20.9%減っています。
#
AIエージェント# #
コンテキスト管理#