过去两年,AI 视频一直在卷画质、时长和真实感。
但对世界模型来说,生成得越长,反而越容易暴露一个致命问题:它根本记不住自己刚刚生成过什么。
AlayaWorld 想解决的,就是这个比画质更难的问题。
一段视频,只要前后几帧看起来连贯,观众通常不会深究背后的空间是否真的存在。
但世界不一样。
你往前走了一段路,转身回来,刚才的房子还得在那里。
你中途召唤了一只怪物,模型不但要马上给出反馈,还得让这件事自然地发生在同一个世界里。
这也是为什么世界模型最难的地方,不是生成,而是状态管理。
AlayaWorld 为这件事加了三层机制:
1. 3D Cache 负责记住东西在哪里。模型离开一个区域再回来时,可以重新找到之前的空间信息。
2. 压缩后的画面历史负责记住刚才发生了什么。它不需要把所有旧画面一直塞进上下文,但又不能把过去全部忘掉。
3.漂移训练和 Error Bank,负责处理模型自己制造的错误。因为生成时间越长,前面一个小错误就越可能污染后面的所有画面。
看到这里,我突然发现,世界模型和 Agent 其实在解决同一个问题。
Agent 运行久了会 context rot,忘记原始任务,被错误的历史信息带偏。
世界模型运行久了也会,只不过它忘记的不是文字,而是街道、建筑、人物和刚刚发生过的事。
所以 AI 的下一场竞争,可能不只是生成质量。
视频模型比的是单次输出。
世界模型比的是持续运行。
谁能让 AI 在运行过程中记得住、改得动、错了还能拉回来,谁才有机会把一次生成变成一个真正可以进入的世界。
AlayaWorld 目前还更像研究级原型。公开的推理流程需要首帧图片、相机轨迹和 Prompt,离普通人打开网页就能玩还有距离。
但它已经把推理代码和模型权重公开了。
这个方向终于不只是看一段官方 Demo,而是可以被下载、检查和验证
@alayastd