@drfeifei 实验室刚刚训练出世界上第一个World Model!这不是简单的视频生成模型, 而是World Labs 在尝试把图像、视频、3D 和时间统一成一个真正的 world model。
读他们的博客, 主要有下面几个技术要点:
1. 它把空间变成了模型原生的 context。
普通多模态模型看到的是一堆图片。Atlas 看到的不只是图片,还知道每张图片在三维空间里的位置和相机姿态。World Labs 把这个叫做 spatial context: 它在一个持续存在的 3D 世界里生成新的观察结果,而不是根据上一帧猜下一帧。
2. 相机控制是模型原生输入,不是 prompt。
你可以直接指定 camera pose 和 camera path,告诉它摄像机准确移动到哪里、朝哪个方向拍,而不是写"camera slowly pans left"这种模糊提示。Atlas 可以从一张图片出发,让摄像机绕到物体背面,生成最长 1 分钟、1440p 的视频,同时保持空间一致性。
3. 一两张照片就能开始建立一个世界。
给 Atlas 一张花园照片,它能推断照片之外可能有什么,生成空中视角。加入第二张 cottage 的照片,它把 cottage 纳入这个世界。加入第三张房子的照片,世界被进一步约束。
模型看到的越多, 就越少依赖想象。 图片少的时候,它用 world knowledge 补全世界;图片越多,它越接近"重建"而不是"生成"。官方称通常只需要 2 到 3 张图片就能得到可信的 reconstruction,也能接收超过 100 张图片。Generation 和 reconstruction 因此成了同一个连续问题的两端,而不是两套独立系统。
4. 输出的不只是视频,还有真正的 3D。
Atlas 能生成 depth map、point cloud,最终生成 3D Gaussian Splat,可以直接导入游戏、机器人、VFX、设计工具的 3D representation,而不是看起来像 3D的视频。从一张图片开始,它就能生成新视角、推断 geometry、变成完整的 Gaussian Splat。这把生成式 AI 从 content generation 推向了 environment generation。
5. 它把手机拍的视频变成机器人 simulation。
流程是:手机拍真实环境 → Atlas 重建 3D 世界 → 放一个虚拟机器人进去 → 模拟机器人看到的 RGB/depth → 训练机器人。World Labs 只用了 24 帧手机视频就重建了一个大型环境,然后能改变机器人路径、物体位置、灯光、背景,生成大量训练场景。这是 Real-to-Sim:过去需要 LiDAR、motion capture、复杂 3D pipeline,现在几台手机就够,机器人训练数据的生成成本会大幅下降。
6. 架构像 LLM 和 diffusion model 生了一个孩子。
Atlas 是一个 multimodal autoregressive diffusion transformer,吸收了两套技术路线:LLM 那边的 KV cache、autoregressive sequence、cache-aware serving、disaggregated serving;diffusion/video 那边的 rectified flow、denoising、CFG、diffusion distillation、VAE。Text、image、camera pose、depth map 都被表示成同一个 multimodal sequence,不同任务只是输入输出组合不同。World Labs 做的不是一个3D 模型,而是把 GPT 式的 base model 范式搬进 spatial world,基本单位从 token 换成了空间。