《晚点聊》具身季报系列第二期:分享具身智能行业季度 Top 5 事件:
1/ 人形机器人马拉松第二年,终端大公司身影浮现
- 4 月 9 日的北京亦庄人形机器人马拉松,荣耀包揽了冠亚季军。他们有接近一两百人的团队,研发投入量级显著高于另外的两大夺冠热门宇树和北人(北京人形机器人创新中心)。荣耀定制了比赛所需的大扭矩电机和精密的液冷机制,当其他公司的机器人因为长时间高速跑动,导致电机过热不得不休息,荣耀的液冷机制让电机温度在整个比赛中都能控制在较低水平。
- 更深一层的信息是,荣耀夺冠预示了未来的竞争格局:大厂认真投入的话,可以快速拿出有竞争力极强的人形机器人产品。而在中国,拥有荣耀这样组织能力、人才能力和资金能力的大厂还很多——小米、小鹏、理想已经开始严肃投入。人形机器人正在从单一技术见长的创业公司视角,演变成一种系统工程和系统作战能力的竞争。
2/ Figure AI 的 200 小时直播:为何物流是人形机器人的好场景?
- 5 月,Figure 连续直播200小时,这是第一次向全球公众展示人形机器人在工业场景的真实价值,三台人形机器人站在真实物流流水线旁做包裹分拣,把包裹翻面、让条码朝上,速度做到约3秒一个,。物流分拣是个好场景——重复、连续、长时间,不适合人类长期做。而之前的机器视觉加工业手臂的方案四五年来一直解决不好,因为快递软包裹上的二维码太容易遮挡和形变,不靠灵巧手很难处理那些长尾的corner case。
- 同期还有个插曲:成都舞者吴宇飞带着 8 台宇树 G1 在美国达人秀现场跳了一段舞,全票晋级。Figure 和这个节目的先后出现,让美国普通百姓非常直观的看到人形机器人怎么进入工业和商业场景。之前很多人看到中国春晚的机器人表演,还会怀疑是不是 AI 生成的、是不是录了很多遍。
- 物流场景在国内也有实质进展。星动纪元和中国邮政、顺丰做了长时间测试,已经能实现全自主的分包、翻面、扫描等一系列工序。中国公司在人形物流工业场景的落地能力,完全不亚于美国。
3/ 灵巧手与灵巧操作:舞肌可能成为灵巧手领域的 G1
- 灵巧手这个季度在 ICRA 维也纳会议上集中爆发。舞肌二代手20个自由度,体积只有全球头部玩家Sharpa的一半,反驱性能和散热大幅改进。舞肌的定位比较像宇树——专注于把一个低成本、高可靠性的硬件设备做到足够耐用,让大家在这个基础上做大量研究。过去一两个月,已经有大量中美创业公司基于舞肌的手发布了灵巧操作模型或工作进展。
- 灵巧操作模型的进展上, Genesis 发布了用定制五指手做的灵巧操作模型,他们公开称采集了约20万小时数据,用舞肌的手实现了拧魔方、做饭、弹钢琴等精细操作,被认为是目前高自由度灵巧操作的SOTA。
4/世界模型:英伟达发布 Cosmos 3,中国世界模型融资热
- 6月1日,英伟达发布 Cosmos 3,一个全开源的全能世界模型,可以原生处理文本、图像、视频、声音和动作,也可以输出这些模态。技术上用一个自回归 transformer 做推理、一个 diffusion transformer 做生成,中间靠共享注意力机制让两种模态相互影响。英伟达把机器人领域的世界模型分成三种:最底层是Video World Model ,本质底座是一个视频生成模型——根据条件或描述生成视频 、第二类是 Action-Conditioned World Model ,前提基于你的动作——给定一个动作,在这个条件下生成世界模型 和 World Action Model ,通过这个模型生成机器人的动作,可能同时也能生成未来的图像或视频。Cosmos 3 在这个分类里被英伟达放在 Video World Model 这一层,但它是一个 Omni-model,理论上三类任务都能做。
- 世界模型成了非常火热的创业风口。国内冒出大量新公司,有些今年刚成立就冲到10亿美元估值,截止到4月初,有人整理出来的世界模型公司名单已经有49家。
5/ Gen-1 和 π0.7 发布,不被 “VLA” 标签框定
- Physical Intelligence 的 π0.7 在一个传统 VLA 的基础上接了一个轻量世界模型,这个轻量的世界模型可以提供对未来任务图像的预测,用这个预测来影响生成模型生成相应的动作,用这个反馈去调整动作生成,类似于人扔纸团前会先脑补一下轨迹。
- Generalist 的 GEN-1 自己采集了50万小时的真实世界交互数据,不依赖预训练的 VLA 和视频生成模型,独立训练了一个端到端 transformer。这显示了对自家技术路线的极高自信,也展示了 Scaling Law 在具身数据上有效——从1万小时到50万小时,泛化能力持续提升。
显示更多