成立两年,这家AI公司的估值都冲到200亿了。
下午在中关村和几个朋友聊天。大家都很感触,智谱转眼之间就成了一个万亿市值的公司,这谁能想到,前两年甚至还觉得人家要黄了。
这就是创业啊,探索逻辑,不是考试逻辑。
顺着 LLM,我们聊到了具身智能。有朋友说,现在国内这批具身智能公司中,谁有智谱或者Anthropic的潜力。
我毫不隐讳的抢答,我自己最看好自变量这家公司。过去一年,我写过很多次自变量的模型。
从我的视角,他们每次的新模型或者新论文还是都能给我不小冲击。
今天是上半年的最后一天,不是很忙,这会坐在电脑前,我想写写自变量这家创业公司。
如果你关注具身智能的话,无论从哪个方向看,自变量基本都绕不开。
而且自变量现在的发展节奏也非常猛。刚刚成立两年时间,最新一轮的估值就已经突破了 200 亿。
美团、阿里、字节、小米这四大互联网公司分别都领投过。
这事还是非常罕见,换个角度说,我们可以理解为这几家互联网公司都非常认可自变量的技术方向或者技术水平,要不然也不可能轮番下重注。
自变量这家创业公司有什么来头?我先说下具身智能模型的背景。
具身智能领域的模型,虽然大家嘴上都说在做大脑,但技术方向其实差别很大。
说白了,具身智能大脑要解决的核心问题就一个,让机器人能够和物理世界交互,像人一样去干活,擦桌子、洗衣服这些。
但具体怎么实现这件事,路线分歧还是比较大的。
从模型结构上看,有的侧重做 VLM,也就是视觉语言模型,核心能力是看图、看视频、回答问题、做推理,对世界的理解更多是语义层面的。
另一条路是世界模型,更关心的是给定一段历史状态和动作序列之后,能不能预测出下一帧世界会变成什么样,关注的是物理约束和因果关系。
而且要训练具体模型模型,数据是绕不开的核心问题。和大语言模型可以从互联网上抓取信息不一样,具身智能的数据得从物理世界采集,这件事本身就很难。
没有那么多现成的数据。
从数据来源看,有的公司会用真实世界的数据,采集成本高、场景杂、噪声多,但贴近真实部署。
有的用仿真环境的数据,在物理引擎里自动刷任务、生成轨迹。训练方式也很多样,有走强化学习的,有做模仿学习的,有先学状态转移再做规划的。
总的来说,这个领域现在还处在百花齐放的阶段,大家方向不同,评测标准也没有统一。
和 LLM 领域完全不一样。毕竟 LLM 领域,大家都在 Transformer 的基础上,做 Scaling Law,做 RL,大的方向是一致的。具身智能方向还没有什么标准答案。
自变量的探索特别有意思。今年 4 月份,他们发布了全球第一个世界统一模型 WALL-B。
之前整个行业做具身模型,主流思路是 VLA,也就是把视觉、语言、动作几个模块拼接起来。
但 VLA 走到后面是有天花板的,因为它的核心范式是模仿,一旦环境发生迁移,就比较麻烦。
后来很多人就在讨论,是不是把世界模型和 VLA 结合起来,在 VLA 上面外挂一个世界模型,因为世界模型能够在脑海里做预演,可以解决任务迁移的问题。
但这种拼接方案,整个行业基本都认为是中间过渡方案。因为拼接就涉及到数据的搬运和迁移。
大模型领域已经印证过这件事了,这两年为什么一直在强调原生多模态?就是希望模型能够原生地去理解多模态信息,而不是非得外挂一个结构。VLA 和世界模型的关系也是同样的道理。
所以当他们在 4 月份发布 WALL-B 的时候,我非常震惊。
自变量做的其实是原生的世界模型,把视觉、语言和动作放到同一个模型里从零开始联合训练,统一的架构,各个能力在一个系统里头直接协同。这是全世界第一个朝这个方向尝试的模型。
WALL-B 是 4 月份发的。然后上个月自变量又在这个基础上发了另一个模型 WALL-WM。
在做完世界统一模型之后,他们又回过头去思考一个更底层的问题:具身智能模型基本单元到底是什么?因为用什么最小单元来建模,会极大影响模型学习什么。
这个在大模型领域已经印证了,视频模型也经历过。比如视觉领域,之前的最小单元是像素,后来大家慢慢发现,更合适的其实是语义。到了语义这个层面,视频模型才有了质的飞跃。
自变量团队沿着这个思路推演,判断具身智能领域也面临同样的问题。现在大部分具身系统,默认的基本单元还是时间序列,按时间均匀采样。
但他们尝试之后认为,这个基本单元应该是关键事件序列,就像人一样,人感知世界不是按固定帧率来的,而是按事件来的。
于是在之前世界统一模型的基础上,他们又提出了事件驱动的世界模型。
先是做了端到端的统一架构的原生世界模型,然后又在这基础上做了事件驱动。
总之我的感觉是,这些探索也许是在倒逼着整个行业去思考,什么才是难而正确的事。
有同学可能会问,是不是你说的这些还是纯概念?
哎,具身智能前两年确实被一些观点带歪了,觉得这行当泡沫很大。其实不是。
一个新技术的演进是涌现式的,用 Anthropic CEO 的话说,是指数级增长。很多人感知不到,是因为在指数曲线的前半段,变化看起来很慢。
但仔细看一看过去这半年,变化其实已经在发生了。好多人嘲笑机器人跑马拉松,觉得这能说明什么。
但隔几个月再去看同一件事,感受是不一样的,明显比之前跑得好太多了。这就是在变化,只是没到那个让所有人都惊掉下巴的时刻而已。
还有很多人可能没注意到,自变量的机器人前段时间已经和 58 到家合作,进入了不少家庭,直接做家务去了。
注意,不是在实验室里做演示,是真的去普通人家里擦桌子收拾东西。还有工业场景也已经在跑了,汽车产线、物流分拣,都在真实环境里干真实的活。
当然,这些都是很微小的开端。就像 GPT-3.5 刚出来的那个阶段,好多人没有看见,还蒙在鼓里,但其实产业渗透已经开始了。
如果对具身智能或者人形机器人感兴趣,推荐去看一看自变量发的一些技术报告和模型。
哪怕不是做这方面研发的,只是作为一个爱好者,看看也会觉得很有意思。
我自己经常去翻这些信息,看完之后大概就能理解目前这个行业遇到了什么问题,以及大家在怎么解决。
光是这个过程本身,就挺有趣的。
顯示更多