註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 WorldModels
WorldModels 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 WorldModels 的搜尋結果
这两年世界模型(World Models)是 AI 里最烧钱的赛道之一,想做机器人、想让 AI 真正走进物理世界的,基本都绕不开它。但你只要多看几个 Demo 就会发现一个通病:这些模型很会“看”——画面能生成得足够逼真,几乎骗得过眼睛;可你真让它回答“我现在动这一下、接下来会连锁出什么”,它常常就卡住了。 说白了,它们学的多半是“相关”——什么和什么经常一起出现、下一帧大概长什么样。在屏幕里写写画画、生成视频,这套绰绰有余;可真实世界是要“动手”的,光知道相关、不懂因果,环境稍微一变就掉链子(它记住的是答案,没记住答案背后的道理,换一道题就露馅)。 一个真正顶用的世界模型,得能在动手前先把事情“想一遍”:它推这一下、抓那一把,会引出什么后果?换种做法,结果又会不会不同?这种“先设想、再验证”的本事,跟数据喂得多不多关系不大,关键在懂不懂因果。 Aether 这次融资要补的,正是世界模型最缺的这块。他们把这条路线叫因果世界模型(Causal World Models),也是全球第一家拿因果当核心架构来做的公司:让模型先把“这么做会怎样”推演明白再决定动作,做错了能顺着结果回头改自己,不用每次推倒重来。 在他们看来,这可能就是 AI 下一代的范式——世界模型从“相关”走到“因果”。这条路好不好走?我老实说,不好走,因果一直是 AI 里最难啃的骨头之一,难到不少人宁可绕开它、继续卷参数。但越是这种硬骨头,越值得有人正经啃一回。能不能成我不敢打包票,可这个方向本身,我觉得值得长期盯着。 公司由黄碧薇 @huang_biwei 创立,她在因果这块磨了整整 12 年——UCSD 助理教授,Causal-Learn 作者之一,百余篇顶会论文,还入选过 Apple Scholar。对世界模型、对这个新范式感兴趣的,可以去看看: @huang_biwei
顯示更多
0
17
23
10
轉發到社區
做大世界模型研究的人很需要这个工具:stable-worldmodel 它做的就是这一块。这个仓库提供可复现的 world model 研究与评测平台,文档、测试、PyPI 包和论文入口都在一处,适合想把实验、对比和结果复核放到同一套流程里的人。 GitHub 现在约 1.5k stars,今天新增 318 stars。 仓库地址:
顯示更多
0
26
23
1
轉發到社區
🔥赛博修仙哪家强?书生、画家、建筑师、禅师和梦游者 ,趣味解读“世界模型”五大门派 2026年,AI圈最热的话题就是世界模型。过去一年半,上百亿美金砸进去,光今年前7个月就冒出来20多家新公司。 要是把这股热潮比作修仙,那各路门派选的功法可太不一样了。书生、画家、建筑师、禅师和梦游者各有其道。 先说最早火起来的那拨书生,即语言中心派。他们的思路特简单:大语言模型不是已经能预测下一个词了嘛,那把图像、视频、动作统统转成文字,不就能接着预测了?小鹏汽车就这么干,把驾驶视频和指令全塞进语言模型里。 但问题也明显。智源的王仲远说得直白:这玩意儿学的是“用语言描述的世界”,不是世界本身。就像个熟读兵书的书生,嘴上头头是道,真上了战场连马都骑不稳。换个摩擦系数或者重力参数,立马抓瞎。 第二拨画家们走的是像素路线。代表人物就是Sora那帮搞视频生成的。他们的想法更直观:世界长什么样,我就让AI看海量视频,学会预测下一帧画面该长什么样。用扩散模型直接生成像素,看起来特华丽。 可这路也有硬伤。业内现在有句话叫“视频生成不等于世界模型”。一个能生成熊熊烈火的模型,可能根本不懂燃烧的物理过程。它学的是像素的统计规律,不是因果逻辑。看得见,摸不着。 第三拨建筑师务实一点,搞三维结构。李飞飞管这个叫“空间智能”,让AI理解三维空间里物体怎么摆放、什么关系。World Labs就在做这个。 但光有形状也不够。你能重建一个杯子的3D模型,却很难告诉AI它摔下来会怎么碎。离真正的“理解”还差得远。 第四拨禅师就有点玄了。LeCun推的JEPA系列,走的是视觉表征路线。它的核心心法是:理解世界,不必重构像素。别人在临摹名画,它偏要去悟画家的笔法逻辑。在潜空间里预测状态变化,不生成任何画面。 好处是参数少、速度快、不怕噪声。但坏处也在这——它到底“悟”到了啥,外人根本看不懂。就像修仙小说里那种闭口禅,外人只道他修为高深,真问他却一个字说不出来。 第五拨梦游者更像梦中证道。以Dreamer为代表的强化学习派,先在脑子里建一个虚拟世界模型,然后在里面反复做梦、模拟、试错。等练得差不多了,再出来实战。蔚来的智驾就是这么搞的,让算法先在模拟的未来里跑个几千遍再上车。 五条路,各有各的牛逼,也各有各的坑。 那为啥到现在还没人能“飞升”? 第一,连“世界模型”到底是个啥都没吵明白。 视频生成也叫世界模型,物理引擎也叫世界模型,概念乱得很。李飞飞专门写了篇长文来厘清,说明这行业连渡劫标准都没统一。 第二,数据根本不够。 大语言模型能从网上扒无穷无尽的文本,但物理世界的数据呢?一个杯子掉地上碎了,人类看一眼就懂,可要让AI学会这个因果,得需要带精确几何和物理标注的多模态数据。这种东西比互联网文本稀缺好几个数量级。 第三,架构还在乱战。 到底是重建像素还是预测潜空间?是生成式还是判别式?到现在没人知道答案。2026年虽然被叫成“世界模型元年”,但元年嘛,就是刚起步的意思,别指望大成。 有意思的是,各家掌门人最近都开始往一块凑了。 李飞飞觉得,渲染、模拟、规划这些知识本质上是同一套,最后应该融成一个统一模型,既能生成照片级画面,又能理解物理因果,还能规划行动。 上海AI Lab那边也在推新思路,世界建模不该只是预测世界,而是服务Agent。说白了,模型得帮AI干活,不能光会看。 我觉得这事最后大概率不是某一条路线胜出,而是谁能把各派功法打通。修仙小说里真正飞升的,往往都是在看似矛盾的功法交汇处找到机缘的。 #WorldModel# #PhysicalAI# #EmbodiedAI#
顯示更多
0
80
33
0
轉發到社區