660条Correction,真正进入训练的只有161条。看到Axis公布的这组数据后,我又回去做了几次Post Training,之前很多操作习惯也跟着变了。
▣ 任务本身不复杂,Policy先控制机械臂执行,我只在它明显处理不了的时候接手。
以前看到夹爪偏掉,我会直接控制机械臂把后面的动作一起做完,现在更愿意只修复 出问题的那几步,位置恢复以后马上点Return to Policy,让机器人自己继续。
这种变化和
@axisrobotics 筛选 Correction的方式有关。
一条操作提交以后,会先被重新Replay,确认整段任务放回模拟环境后还能正常完成。那次实验一共收集660条Correction,其中496条通过了这一步。
后面还会检查人工接手是不是真的有必要。Policy从相同状态重新开始时,本身要确实无法完成任务,而且到了用户接管的位置,问题依然存在。经过这部分处理,剩下414条。
◇ ───────── ◇
我最在意的是后面的Recovery Test。
Axis只保留一小段人工修正,再把控制权还给Policy,看机器人能不能从修正后的状态继续把任务完成。经过这一轮,真正留下的只有161条,每段保留的修正平均约0.8秒。
▹ 看到这里,再做Post Training时,我已经不会接管以后一路替机器人干完。
夹爪抓偏了,就把位置修回来,能交还控制权就尽快点Return to Policy。
做了几次以后很容易体会到,Axis想留下的并不是一整段漂亮的人工作业,而是那几步修正能不能把Policy从错误状态拉回来,让它自己接着把事情做完。
◈ 下一篇,我想继续看看这161条Correction进入训练以后,Policy的表现到底发生了什么变化。