TwiScan
熱門
社區
帳號集合
登入
註冊
English
日本語
한국의
简体中文
繁体中文
註冊並分享邀請連結,可獲得影片播放與邀請獎勵。
立即註冊
Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント
@snorbe_ai
を作っています。
@deskrex
| 著書 かんき出版『知的生産でAIを使いこなす全技法』
加入 January 2018
392
正在關注
2.6K
粉絲
Itaru Tomita / 冨田到
@itarutomy
2026.08.10 15:04
マルチモーダルAI(画像と文章を一緒に理解して答えるAI)が「自分で描いた図を本当に見て考えているか」を検証した論文が出た(https://arxiv[.]org/abs/2607.26769)。 GPT-5.5やGemini 3.5 Flashなどの最新モデルは、問題を解く途中で補助線を引いたり対象に印をつけたりと、人間が紙に書き込むような視覚的な操作を自分で生成しながら考えるようになってきた。ただ、その絵が答えを導く助けになっているのか、単なる飾りなのかは、これまできちんと切り分けられていなかった。 研究チームはSee2Thinkという評価の枠組みを作った。幾何・3D空間認識・日常シーンの読み取りなど12カテゴリ、合計1,200問を用意し、AIが「考える→図を描く→描いた結果を見てさらに考える」流れを記録する。実験の一つでは、AIに見せる描画結果をわざと間違ったものにすり替え、AIが本当にその絵に依存しているかも確かめた。 結果はややちぐはぐだった。AIが「どこに何を描くべきか」を選ぶ判断の妥当性(論文ではAction Relevanceと呼ぶ指標)は全体平均で96.4〜98.8%とほぼ満点なのに、実際に描いた絵が指示通り正確に再現されているか(Render Faithfulness)は58.6〜65.6%にとどまる。狙いは正しくても手元が狂う工程こそが最大のボトルネックで、どの条件が一番強いかもモデルごとにバラバラで万能な戦略はなかった。 「指定された麻雀牌を1枚拾う」のようなロボット操作の指示になると、モデルや条件を問わず正答率は0〜4%まで落ち込む。さらに、わざと間違った絵を見せる実験では特に3Dの空間問題で正答率が最大15.5ポイントも落ち込んだ。正確に描けても得点はさほど伸びないのに、間違った絵には引きずられて答えを変えてしまう。「絵を使って考えるAI」も、まだ自分の描いた絵を十分に使いこなせていない、という結果だ。
顯示更多
0
0
1
25
3
轉發到社區
熱門用戶
New York Post
@nypost
4.1M 粉絲
Reuters
@Reuters
26.3M 粉絲
一劍浣春秋
@chee828
230.6K 粉絲
オリコンニュース
@oricon
1.9M 粉絲
Hello! Project Link
@UpFrontLink
15.5K 粉絲
billboard
@billboard
16.5M 粉絲
BABYMONSTER
@YGBABYMONSTER_
956K 粉絲
彭博商業周刊 / 中文版
@BloombergBWCN
41.5K 粉絲
Forbes
@Forbes
20.3M 粉絲
MLB
@MLB
0 粉絲
Pop Base
@PopBase
6.5M 粉絲
是你的KK
@KKLOVQ
0 粉絲
First Squawk
@FirstSquawk
556.4K 粉絲
BLACKPINKOFFICIAL
@BLACKPINK
11.6M 粉絲
Binance
@binance
16.1M 粉絲