🔥赛博修仙哪家强?书生、画家、建筑师、禅师和梦游者 ,趣味解读“世界模型”五大门派
2026年,AI圈最热的话题就是世界模型。过去一年半,上百亿美金砸进去,光今年前7个月就冒出来20多家新公司。
要是把这股热潮比作修仙,那各路门派选的功法可太不一样了。书生、画家、建筑师、禅师和梦游者各有其道。
先说最早火起来的那拨书生,即语言中心派。他们的思路特简单:大语言模型不是已经能预测下一个词了嘛,那把图像、视频、动作统统转成文字,不就能接着预测了?小鹏汽车就这么干,把驾驶视频和指令全塞进语言模型里。
但问题也明显。智源的王仲远说得直白:这玩意儿学的是“用语言描述的世界”,不是世界本身。就像个熟读兵书的书生,嘴上头头是道,真上了战场连马都骑不稳。换个摩擦系数或者重力参数,立马抓瞎。
第二拨画家们走的是像素路线。代表人物就是Sora那帮搞视频生成的。他们的想法更直观:世界长什么样,我就让AI看海量视频,学会预测下一帧画面该长什么样。用扩散模型直接生成像素,看起来特华丽。
可这路也有硬伤。业内现在有句话叫“视频生成不等于世界模型”。一个能生成熊熊烈火的模型,可能根本不懂燃烧的物理过程。它学的是像素的统计规律,不是因果逻辑。看得见,摸不着。
第三拨建筑师务实一点,搞三维结构。李飞飞管这个叫“空间智能”,让AI理解三维空间里物体怎么摆放、什么关系。World Labs就在做这个。
但光有形状也不够。你能重建一个杯子的3D模型,却很难告诉AI它摔下来会怎么碎。离真正的“理解”还差得远。
第四拨禅师就有点玄了。LeCun推的JEPA系列,走的是视觉表征路线。它的核心心法是:理解世界,不必重构像素。别人在临摹名画,它偏要去悟画家的笔法逻辑。在潜空间里预测状态变化,不生成任何画面。
好处是参数少、速度快、不怕噪声。但坏处也在这——它到底“悟”到了啥,外人根本看不懂。就像修仙小说里那种闭口禅,外人只道他修为高深,真问他却一个字说不出来。
第五拨梦游者更像梦中证道。以Dreamer为代表的强化学习派,先在脑子里建一个虚拟世界模型,然后在里面反复做梦、模拟、试错。等练得差不多了,再出来实战。蔚来的智驾就是这么搞的,让算法先在模拟的未来里跑个几千遍再上车。
五条路,各有各的牛逼,也各有各的坑。
那为啥到现在还没人能“飞升”?
第一,连“世界模型”到底是个啥都没吵明白。
视频生成也叫世界模型,物理引擎也叫世界模型,概念乱得很。李飞飞专门写了篇长文来厘清,说明这行业连渡劫标准都没统一。
第二,数据根本不够。
大语言模型能从网上扒无穷无尽的文本,但物理世界的数据呢?一个杯子掉地上碎了,人类看一眼就懂,可要让AI学会这个因果,得需要带精确几何和物理标注的多模态数据。这种东西比互联网文本稀缺好几个数量级。
第三,架构还在乱战。
到底是重建像素还是预测潜空间?是生成式还是判别式?到现在没人知道答案。2026年虽然被叫成“世界模型元年”,但元年嘛,就是刚起步的意思,别指望大成。
有意思的是,各家掌门人最近都开始往一块凑了。
李飞飞觉得,渲染、模拟、规划这些知识本质上是同一套,最后应该融成一个统一模型,既能生成照片级画面,又能理解物理因果,还能规划行动。
上海AI Lab那边也在推新思路,世界建模不该只是预测世界,而是服务Agent。说白了,模型得帮AI干活,不能光会看。
我觉得这事最后大概率不是某一条路线胜出,而是谁能把各派功法打通。修仙小说里真正飞升的,往往都是在看似矛盾的功法交汇处找到机缘的。
#
WorldModel# #
PhysicalAI# #
EmbodiedAI#