注册并分享邀请链接,可获得视频播放与邀请奖励。

AI Dance
@AI_Whisper_X
China AI insider | Silicon Valley Decoded 一边盯硅谷,一边扒中国AI 算法 + VC 双视角 · 讲人话 📬 aidance.info@gmail.com
加入 October 2024
293 正在关注    5.9K 粉丝
不搞VLA了啊?Agent直接接管机器人 刚刷到 YC 这批里一家叫 Waddle Labs 的公司,总共 2 个人,两个创始人还在哈佛读书。。blog 里最狠的一件事是:不需要 VLA,不采数据,LLM agent 自己从零训了个 ACT policy。 他们的路线跟主流完全反着来。不搞端到端,让 LLM agent 直接接管机器人:看摄像头、拆任务、写控制代码,VLA 从主干降级成一个随叫随到的 tool。YC 合伙人给的定位是“Claude Code for robots”。 他们发了个demo:agent 通宵抓放乐高,换着位置和朝向重复了大概一千次,然后拿自己造的数据 from scratch 训出一个能抓乐高的 ACT policy。具身智能最贵的两件事,采数据和训模型,它一个通宵自己闭环了。。 还有个细节。他们拿 Opus 4.8、Fable 5、GPT 5.6 跑同一套 manipulation 任务,捡乐高谁都行,但叠 T 恤只有 Fable 5 和 GPT 5.6 开着 xhigh thinking 才做得到。也就是说,机器人的能力上限,直接和 LLM 的能力挂钩。 这跟 Anthropic 的 Claude Plays Robotics 是一个意思。 我感觉这个思路本质上是在回答一个问题:机器人智能的“操作系统”到底是端到端的神经网络,还是一个能调用各种工具(包括神经网络)的agent?Waddle选了后者。 当然,code-as-policy这条线不是新东西。Google 2022年就发了Code as Policies,后面CaP-X、ASPIRE、Voyager都在做。Waddle自己也在blog里老老实实说这是convergence。但把这条线做到“runs as a deployed system”、让多个agent共享一个skill library,确实是工程上往前走了一步。 以及现在的模型能力,确实是不一样了。 蛮有意思的新方向。 今天还看到另外一家,Enigma_AI,也是完成了 7100 万美元的种子轮融资。他们的路线是让机器人具备交互能力,把 100 台真实的 AI 机器人放到了网上。现在,世界上任何人都可以通过浏览器实时操控它们。 机器人背后是 AI 模型,人从浏览器远程操控真机,操作产生的数据又继续拿去训模型。 也是蛮有意思的。不过这个我还没有交互成功,所以还没单独发帖哈哈。
显示更多
We put 100 real AI-powered robots online. Anyone in the world can control them right now, from a browser. Go make one do something: