我这几天被
@axisrobotics 的双臂任务折腾得坏了,人都萎了,这种数据收集方式,对我这种手残党太难了。
难道,除了这种没有别的更人性化的训练方式了吗?我尝试去学习了解具身智能的数据采集方式。
目前主流的方法,大致有四条路。
真机遥操作是最直接的一种。
操作员戴上VR眼镜,握着手柄或遥操作手套,实时操控特定型号的机器人完成任务,同时记录关节角度、力反馈这些信息。
好处很明显:数据质量高,跟目标机器人贴合紧密,力触觉信息完整,训练出的模型基本可以直接部署。但代价也大,设备贵,需要真机和专用场地,人员配合成本高。而且数据跟机型强绑定,换一台机器人就很难复用,场景也相对固定,采集效率自然上不去。
为了降低门槛,UMI(通用操作接口)给出了另一种思路。
操作员手持一个标准化的夹爪,通常就是3D打印件加上运动相机,在真实场景里直接操作,记录末端视角、夹爪状态和运动轨迹。设备便宜、便携,数据还能在不同机器人和夹爪之间复用。
但精细操作还是受限:夹爪本身不够自然,像拧螺丝这类任务就很难完成;同时缺少环境和行走决策信息,主要适用于机械臂训练。
动作捕捉则更贴近人的自然动作。
通过穿戴设备记录人体和手部关键点的轨迹,再映射到机器人系统。动作自然,成本相对可控,也不用部署真实机器人,适合批量采集。
问题在于场景受限:多数设备需要专用空间,很难进入家庭或真实非结构化环境,对遮挡也比较敏感。
成本最低、规模潜力最大的,是Ego(第一人称视频)。
采集员只需佩戴头戴式相机等简单设备,以第一视角记录日常操作,包含手部动作、环境信息和身体关键点。设备简单,容易在家庭、商超等真实场景里大规模众包。信息也丰富,蕴含人类决策逻辑和手物交互细节。
但精度有限,缺乏力触觉和精确的关节轨迹,手部关键点往往要靠后期预测。原始视频里还有大量无效片段,清洗和对齐的工作量不小。
像Axis Robotics这样的平台,目前走的是仿真环境下的遥操作路线。
用户在浏览器里用键盘、鼠标控制模拟的双臂机器人,生成关节状态、物体位姿和控制动作数据。这有点像真机遥操作的“模拟版”,降低了硬件门槛,能快速积累大规模轨迹。
但跟真实物理数据终究有差距,操作学习曲线依然存在,普通人要熟练掌握并不容易。Axis也在推进移动端的第一人称数据采集,尝试把仿真和真实Ego数据结合起来。
回过头看,如果未来可穿戴智能设备能更成熟地捕捉自然动作、力反馈和场景信息,数据采集或许会接近我们最初的想象,不需要复杂的遥操作,直接从日常行为里提取高质量物理数据。
到那时,训练机器人的门槛才能真正降下来,数据规模和多样性也才能跟上模型的进步。
每种方式都有取舍。真机遥操作求精度,UMI和动作捕捉重便携与自然,Ego主打规模。实际应用中,往往要多种方式互补,既保证数据质量,又覆盖足够多的场景。
#
PhysicalAI# #
Robotics# #
EmbodiedAI#