看完
@axisrobotics V2 之后,有个变化我一直觉得挺贴机器人训练本身。
早期收数据的时候,人会完整操作机器人,把一整个任务怎么完成留下来。
等模型自己已经能跑一部分以后,收数据的方式开始变了。先让机器人自己做,快失败的时候人再接管,把它拉回能继续完成任务的位置。
Axis 后面已经收了 500+ 小时这类人工纠正数据。
问题也跟着出来了:人把机器人救回来,不代表整段操作都值得学。
他们后来做的那组实验里,660 条人工纠错最后只有 161 条短片段进了训练。很多看起来“最后成功”的操作,其实中间带着停顿、犹豫、重复调整,整段照着学,模型表现还会掉。
所以现在这条线已经挺清楚了。
前面的大量完整操作负责把任务教会,模型开始自己跑以后,再去找那些经常出错的地方,人只补关键几步。
这个变化我觉得很适合 Axis。
它本来就在做大规模社区数据,数据越多以后,怎么把人力放到模型最需要的地方,会越来越重要。
机器人已经会的东西继续让它自己做,老是做错的地方再让人进去修。
这样才像是在训练一个会慢慢进步的机器人。