注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 WorldModels
WorldModels 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 WorldModels 的推特
这两年世界模型(World Models)是 AI 里最烧钱的赛道之一,想做机器人、想让 AI 真正走进物理世界的,基本都绕不开它。但你只要多看几个 Demo 就会发现一个通病:这些模型很会“看”——画面能生成得足够逼真,几乎骗得过眼睛;可你真让它回答“我现在动这一下、接下来会连锁出什么”,它常常就卡住了。 说白了,它们学的多半是“相关”——什么和什么经常一起出现、下一帧大概长什么样。在屏幕里写写画画、生成视频,这套绰绰有余;可真实世界是要“动手”的,光知道相关、不懂因果,环境稍微一变就掉链子(它记住的是答案,没记住答案背后的道理,换一道题就露馅)。 一个真正顶用的世界模型,得能在动手前先把事情“想一遍”:它推这一下、抓那一把,会引出什么后果?换种做法,结果又会不会不同?这种“先设想、再验证”的本事,跟数据喂得多不多关系不大,关键在懂不懂因果。 Aether 这次融资要补的,正是世界模型最缺的这块。他们把这条路线叫因果世界模型(Causal World Models),也是全球第一家拿因果当核心架构来做的公司:让模型先把“这么做会怎样”推演明白再决定动作,做错了能顺着结果回头改自己,不用每次推倒重来。 在他们看来,这可能就是 AI 下一代的范式——世界模型从“相关”走到“因果”。这条路好不好走?我老实说,不好走,因果一直是 AI 里最难啃的骨头之一,难到不少人宁可绕开它、继续卷参数。但越是这种硬骨头,越值得有人正经啃一回。能不能成我不敢打包票,可这个方向本身,我觉得值得长期盯着。 公司由黄碧薇 @huang_biwei 创立,她在因果这块磨了整整 12 年——UCSD 助理教授,Causal-Learn 作者之一,百余篇顶会论文,还入选过 Apple Scholar。对世界模型、对这个新范式感兴趣的,可以去看看: @huang_biwei |
显示更多
0
17
23
10
转发到社区
做大世界模型研究的人很需要这个工具:stable-worldmodel 它做的就是这一块。这个仓库提供可复现的 world model 研究与评测平台,文档、测试、PyPI 包和论文入口都在一处,适合想把实验、对比和结果复核放到同一套流程里的人。 GitHub 现在约 1.5k stars,今天新增 318 stars。 仓库地址:
显示更多
0
26
23
1
转发到社区
🔥Physical AI 的演进,必然走“农村包围城市”这条路。 数字世界的AI,打法是先攻大城市。大语言模型靠海量文本练出通用能力,再向垂直领域渗透。城市拿下,交通要塞到手,农村自然归附。 但物理世界完全不同。真实环境里,摩擦力、碰撞、变形、多物理场耦合无处不在。一个简单的爬墙动作,仿真计算量就可能指数级爆炸。想直接得到一个通用的物理世界模型,几乎不现实。 所以物理AI只能从垂直场景起步,先在一个个具体场景里做透,把局部模型打磨到极致,再慢慢拼出更大的版图。 自动驾驶的发展就是例证。它最早没有直接冲进城市开放道路,而是从矿区、港口、封闭园区这些结构化、变化频率低的场景开始。这些场景跑通后,数据和算法才有了可靠地基。等到干线物流和高速场景成熟,城市RoboTaxi才慢慢落地。物理约束太强,数据成本太高,只能从“农村”起步。 工业领域同样如此。早期的并联机器人和混联机器人,先在特定流水线、数控机床上站稳脚跟,再逐步向外扩展。波士顿动力的四足机器人长期专注复杂地形移动,没有一开始就追求通用人形。农业机器人也先盯住单一作物的采摘或喷洒,积累足够的田间数据后,才考虑多作物泛化。 世界模型在这条路径里扮演关键角色。它不用一开始就覆盖整个物理宇宙,而是先为某个垂直场景建一个高保真的局部世界。机器人在里面用强化学习自我迭代,上限远高于单纯的模仿学习。围棋棋盘是AlphaGo的极简世界模型,蛋白质结构是AlphaFold的微观世界模型。多物理场仿真技术,正好是构建这类局部世界的基础。 数据获取方式也在推动这种演进。家用服务机器人还在花钱雇人采数据,自动驾驶靠用户买车免费贡献里程。而在工业巡检、高空作业等特种场景中,作业过程本身就能产生真实工况数据,把“赚钱”和“收数据”绑在一起。谁先在真实环境里把数据飞轮转起来,谁就更有机会把局部模型做扎实。 最终当然会走向融合。不同场景的模型通过商业互换或开源协议拼接,或许能拼出更完整的物理世界图景。但这个过程必然漫长,也必然从边缘开始。 物理AI没有天降神兵。原子移动比比特慢得多,真实数据的获取成本和周期远超数字世界。只有那些愿意在脏乱险的现场把模型一点点做透的人,才真正在为通用物理智能铺路。 农村站稳了,城市才会慢慢被包围。 #WorldModel# #PhysicalAI# #EmbodiedAI#
显示更多
🔥赛博修仙哪家强?书生、画家、建筑师、禅师和梦游者 ,趣味解读“世界模型”五大门派 2026年,AI圈最热的话题就是世界模型。过去一年半,上百亿美金砸进去,光今年前7个月就冒出来20多家新公司。 要是把这股热潮比作修仙,那各路门派选的功法可太不一样了。书生、画家、建筑师、禅师和梦游者各有其道。 先说最早火起来的那拨书生,即语言中心派。他们的思路特简单:大语言模型不是已经能预测下一个词了嘛,那把图像、视频、动作统统转成文字,不就能接着预测了?小鹏汽车就这么干,把驾驶视频和指令全塞进语言模型里。 但问题也明显。智源的王仲远说得直白:这玩意儿学的是“用语言描述的世界”,不是世界本身。就像个熟读兵书的书生,嘴上头头是道,真上了战场连马都骑不稳。换个摩擦系数或者重力参数,立马抓瞎。 第二拨画家们走的是像素路线。代表人物就是Sora那帮搞视频生成的。他们的想法更直观:世界长什么样,我就让AI看海量视频,学会预测下一帧画面该长什么样。用扩散模型直接生成像素,看起来特华丽。 可这路也有硬伤。业内现在有句话叫“视频生成不等于世界模型”。一个能生成熊熊烈火的模型,可能根本不懂燃烧的物理过程。它学的是像素的统计规律,不是因果逻辑。看得见,摸不着。 第三拨建筑师务实一点,搞三维结构。李飞飞管这个叫“空间智能”,让AI理解三维空间里物体怎么摆放、什么关系。World Labs就在做这个。 但光有形状也不够。你能重建一个杯子的3D模型,却很难告诉AI它摔下来会怎么碎。离真正的“理解”还差得远。 第四拨禅师就有点玄了。LeCun推的JEPA系列,走的是视觉表征路线。它的核心心法是:理解世界,不必重构像素。别人在临摹名画,它偏要去悟画家的笔法逻辑。在潜空间里预测状态变化,不生成任何画面。 好处是参数少、速度快、不怕噪声。但坏处也在这——它到底“悟”到了啥,外人根本看不懂。就像修仙小说里那种闭口禅,外人只道他修为高深,真问他却一个字说不出来。 第五拨梦游者更像梦中证道。以Dreamer为代表的强化学习派,先在脑子里建一个虚拟世界模型,然后在里面反复做梦、模拟、试错。等练得差不多了,再出来实战。蔚来的智驾就是这么搞的,让算法先在模拟的未来里跑个几千遍再上车。 五条路,各有各的牛逼,也各有各的坑。 那为啥到现在还没人能“飞升”? 第一,连“世界模型”到底是个啥都没吵明白。 视频生成也叫世界模型,物理引擎也叫世界模型,概念乱得很。李飞飞专门写了篇长文来厘清,说明这行业连渡劫标准都没统一。 第二,数据根本不够。 大语言模型能从网上扒无穷无尽的文本,但物理世界的数据呢?一个杯子掉地上碎了,人类看一眼就懂,可要让AI学会这个因果,得需要带精确几何和物理标注的多模态数据。这种东西比互联网文本稀缺好几个数量级。 第三,架构还在乱战。 到底是重建像素还是预测潜空间?是生成式还是判别式?到现在没人知道答案。2026年虽然被叫成“世界模型元年”,但元年嘛,就是刚起步的意思,别指望大成。 有意思的是,各家掌门人最近都开始往一块凑了。 李飞飞觉得,渲染、模拟、规划这些知识本质上是同一套,最后应该融成一个统一模型,既能生成照片级画面,又能理解物理因果,还能规划行动。 上海AI Lab那边也在推新思路,世界建模不该只是预测世界,而是服务Agent。说白了,模型得帮AI干活,不能光会看。 我觉得这事最后大概率不是某一条路线胜出,而是谁能把各派功法打通。修仙小说里真正飞升的,往往都是在看似矛盾的功法交汇处找到机缘的。 #WorldModel# #PhysicalAI# #EmbodiedAI#
显示更多
0
80
33
0
转发到社区