注册并分享邀请链接,可获得视频播放与邀请奖励。

lidang 立党 (劝人卖房/学CS/买SP500/纳100/OpenAI/Anthrop第一人)
@lidangzzz
co-founder @HedgehogLabHQ @Project_DARC (私信提问前请务必先到YouTube频道观看各期解答世间万物节目,有问题请到X Space上麦直接询问,未回私信证明你的问题已经在YouTube回答过了)
加入 April 2009
2.7K 正在关注    1.6M 粉丝
我为什么反复强调VLM(multimodal,多模态)是死路一条,世界模型更是臭狗屎。 一个最简单的第一性原理,100k tokens文字的信息量,远远高于图片,更远远远远高于视频,这些量文字形式能解决一些超级复杂完备的问题,而对于VLM输入图片,信息极其稀疏,能解决的问题基本约等于狗几把。 如果人类在1T~10T的VLM Agent能解决一个难度为X的问题, 那么同等模型下,对应纯文字LLM Agent给足上下文、memory、wiki、信息,全部以pure text和structured data形式准备好,并且通过text/bash/cli/api/mcp形式获取信息,那么这个LLM Agent一定能解决难度为1000X的问题。 等到VLM强大到让一个VLM Agent解决难度为1000X的问题的时候,LLM Agent已经可以解决(1000^2) * X难度的问题了。 就这么简单一个道理,绝大多数人根本想不明白。
显示更多
0
64
150
13
转发到社区