TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント
@snorbe_ai
を作っています。
@deskrex
| 著書 かんき出版『知的生産でAIを使いこなす全技法』
加入 January 2018
392
正在关注
2.6K
粉丝
Itaru Tomita / 冨田到
@itarutomy
2026.08.12 07:00
画像を見ながらOCRや検索といった外部ツールを使って答えを出すマルチモーダルAIエージェントの評価を、最終的な正解率だけで済ませるのは足りない、と指摘する論文が出た( 正解にたどり着けたとしても、それが根拠のある推論の結果なのか、途中の誤りがたまたま打ち消し合って正解しただけなのかは、最終的な正誤だけでは見分けがつかない。論文はこうした失敗パターンを4つに整理しているが、なかでも厄介なのが「Phantom Grounding」と呼ぶ現象だ。証拠そのものは正しく引用しているのに、結論に出てくる数字や固有名詞がその証拠には書かれていない、一見もっともらしいのに中身が伴わないケースを指す。 研究チームが提案するLedgerMindは、推論の途中経過を1本のテキストに垂れ流すのをやめ、ツールの出力(OCR結果や検索結果など)を出どころ・種類・信頼度付きの「証拠台帳(Structured Evidence Ledger)」として記録する。以降の推論は台帳に載っている証拠しか引用できないうえ、引用しているだけでは不十分だとして、結論の数字や固有名詞が引用元の証拠と実際に一致しているかまで照合する。簡単な質問には軽い経路、複雑な質問には重い経路へ自動で振り分け、余計な深読みで正しい答えを崩す「考えすぎ」も防ぐ。さらに、間違いに気づいたときの修正も自由に書き直させず、証拠の差し替えやツールの呼び直しなど決まった操作だけに絞っている。自由な書き直しは、直しているつもりで新しい未検証の主張を紛れ込ませやすいためだ。 VTC-Benchというベンチマークでは、Gemini-3-Flashと組み合わせて58.9%(同じモデル単体の素の性能から+12.4ポイント)まで伸ばし、既存手法の最高値を更新している。検証した中で一番性能が低かったKimi-K2.6ほど伸び幅が大きく、あるサブベンチマークでは正解率が19.5%から46.0%(+26.5ポイント)まで跳ね上がった。もっとも興味深いのはアブレーション実験(仕組みを1つずつ外して効果を確かめる実験)で、この証拠台帳を丸ごと外すと正解率が68.9%から53.5%まで急落する。「証拠を引用しろ」と指示するだけでは足りず、構造として引用先を強制する部分こそが効いている、という結果だ。
显示更多
0
0
0
9
2
转发到社区
热门用户
狱
@Wx1n11124
0 粉丝
New York Post
@nypost
4.2M 粉丝
オリコンニュース
@oricon
1.9M 粉丝
吴说区块链
@wublockchain12
181.5K 粉丝
Reuters
@Reuters
26.4M 粉丝
First Squawk
@FirstSquawk
569.2K 粉丝
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 粉丝
TVer新着
@TVer_info
100.9K 粉丝
玉米棒棒
@fljjx61
0 粉丝
billboard
@billboard
16.8M 粉丝
空空道人
@Kongkongda5882
34.2K 粉丝
华尔街观察 Xtrader
@cnfinancewatch
130K 粉丝
中國新聞社
@CNS1952
547.7K 粉丝
Bloomberg
@business
10.5M 粉丝
看中國
@kanzhongguo
348.9K 粉丝