TwiScan
熱門
社區
帳號集合
登入
註冊
English
日本語
한국의
简体中文
繁体中文
註冊並分享邀請連結,可獲得影片播放與邀請獎勵。
立即註冊
lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)
@lidangzzz
co-founder
@HedgehogLabHQ
@Project_DARC
(私信提问前请务必先到YouTube频道观看各期解答世间万物节目,有问题请到X Space上麦直接询问,未回私信证明你的问题已经在YouTube回答过了)
加入 April 2009
2.7K
正在關注
1.6M
粉絲
lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)
@lidangzzz
2026.08.18 02:12
我为什么反复强调VLM(multimodal,多模态)是死路一条,世界模型更是臭狗屎。 一个最简单的第一性原理,100k tokens文字的信息量,远远高于图片,更远远远远高于视频,这些量文字形式能解决一些超级复杂完备的问题,而对于VLM输入图片,信息极其稀疏,能解决的问题基本约等于狗几把。 如果人类在1T~10T的VLM Agent能解决一个难度为X的问题, 那么同等模型下,对应纯文字LLM Agent给足上下文、memory、wiki、信息,全部以pure text和structured data形式准备好,并且通过text/bash/cli/api/mcp形式获取信息,那么这个LLM Agent一定能解决难度为1000X的问题。 等到VLM强大到让一个VLM Agent解决难度为1000X的问题的时候,LLM Agent已经可以解决(1000^2) * X难度的问题了。 就这么简单一个道理,绝大多数人根本想不明白。
顯示更多
0
0
64
150
13
轉發到社區
熱門用戶
オリコンニュース
@oricon
1.9M 粉絲
空空道人
@Kongkongda5882
30.8K 粉絲
吴说区块链
@wublockchain12
180.6K 粉絲
华尔街观察 Xtrader
@cnfinancewatch
126.8K 粉絲
中國新聞社
@CNS1952
547.1K 粉絲
TVer新着
@TVer_info
100K 粉絲
乐老爺 #JAV
@HappyLok1157
207.5K 粉絲
一劍浣春秋
@chee828
231K 粉絲
看中國
@kanzhongguo
348.3K 粉絲
彭博商業周刊 / 中文版
@BloombergBWCN
41.6K 粉絲
New York Post
@nypost
4.1M 粉絲
TPE48
@official_TPE48
11K 粉絲
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K 粉絲
小牛
@Xiaoniu6161
188.6K 粉絲
0x鸣人
@LuBtc888
102.6K 粉絲