TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)
@lidangzzz
co-founder
@HedgehogLabHQ
@Project_DARC
(私信提问前请务必先到YouTube频道观看各期解答世间万物节目,有问题请到X Space上麦直接询问,未回私信证明你的问题已经在YouTube回答过了)
加入 April 2009
2.7K
正在关注
1.6M
粉丝
lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)
@lidangzzz
2026.08.18 02:12
我为什么反复强调VLM(multimodal,多模态)是死路一条,世界模型更是臭狗屎。 一个最简单的第一性原理,100k tokens文字的信息量,远远高于图片,更远远远远高于视频,这些量文字形式能解决一些超级复杂完备的问题,而对于VLM输入图片,信息极其稀疏,能解决的问题基本约等于狗几把。 如果人类在1T~10T的VLM Agent能解决一个难度为X的问题, 那么同等模型下,对应纯文字LLM Agent给足上下文、memory、wiki、信息,全部以pure text和structured data形式准备好,并且通过text/bash/cli/api/mcp形式获取信息,那么这个LLM Agent一定能解决难度为1000X的问题。 等到VLM强大到让一个VLM Agent解决难度为1000X的问题的时候,LLM Agent已经可以解决(1000^2) * X难度的问题了。 就这么简单一个道理,绝大多数人根本想不明白。
显示更多
0
0
64
150
13
转发到社区
热门用户
狱
@Wx1n11124
191.4K 粉丝
オリコンニュース
@oricon
1.9M 粉丝
空空道人
@Kongkongda5882
30.8K 粉丝
吴说区块链
@wublockchain12
180.6K 粉丝
TVer新着
@TVer_info
100K 粉丝
中國新聞社
@CNS1952
547.1K 粉丝
乐老爺 #JAV
@HappyLok1157
207.5K 粉丝
New York Post
@nypost
4.1M 粉丝
华尔街观察 Xtrader
@cnfinancewatch
126.8K 粉丝
一劍浣春秋
@chee828
231K 粉丝
彭博商業周刊 / 中文版
@BloombergBWCN
41.6K 粉丝
看中國
@kanzhongguo
348.3K 粉丝
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K 粉丝
小牛
@Xiaoniu6161
188.6K 粉丝
TPE48
@official_TPE48
11K 粉丝