注册并分享邀请链接,可获得视频播放与邀请奖励。

拳头👊🕊️
@pvyyu42928466
TGE 追踪|撸毛实测|Web3 项目投研 AI 模型与 Agent 工具测评 筛选信息,拆解机制,只分享经过验证的判断
加入 October 2023
12.5K 正在关注    15.4K 粉丝
660条Correction,真正进入训练的只有161条。看到Axis公布的这组数据后,我又回去做了几次Post Training,之前很多操作习惯也跟着变了。 ▣ 任务本身不复杂,Policy先控制机械臂执行,我只在它明显处理不了的时候接手。 以前看到夹爪偏掉,我会直接控制机械臂把后面的动作一起做完,现在更愿意只修复 出问题的那几步,位置恢复以后马上点Return to Policy,让机器人自己继续。 这种变化和 @axisrobotics 筛选 Correction的方式有关。 一条操作提交以后,会先被重新Replay,确认整段任务放回模拟环境后还能正常完成。那次实验一共收集660条Correction,其中496条通过了这一步。 后面还会检查人工接手是不是真的有必要。Policy从相同状态重新开始时,本身要确实无法完成任务,而且到了用户接管的位置,问题依然存在。经过这部分处理,剩下414条。 ◇ ───────── ◇ 我最在意的是后面的Recovery Test。 Axis只保留一小段人工修正,再把控制权还给Policy,看机器人能不能从修正后的状态继续把任务完成。经过这一轮,真正留下的只有161条,每段保留的修正平均约0.8秒。 ▹ 看到这里,再做Post Training时,我已经不会接管以后一路替机器人干完。 夹爪抓偏了,就把位置修回来,能交还控制权就尽快点Return to Policy。 做了几次以后很容易体会到,Axis想留下的并不是一整段漂亮的人工作业,而是那几步修正能不能把Policy从错误状态拉回来,让它自己接着把事情做完。 ◈ 下一篇,我想继续看看这161条Correction进入训练以后,Policy的表现到底发生了什么变化。
显示更多
上次写到做Pre Training时,机械臂基本全程由我控制,到了Axis V2的Post Training,玩法完全换了,我第一次进去甚至刻意没碰控制键,就是想看看Policy自己能做到哪一步。 进入 @axisrobotics Hub后,我找到开放Post Training的任务,点击Continue,等Policy显示Ready,机械臂就会自己开始执行。 刚开始我看到夹爪位置有点偏,下意识就想接手,忍了几秒以后,它自己又把位置调整了回来。 后来再做,我不会一看到动作不顺就干预,而是等它明显处理不了再接管。 ◉ 有一次夹爪已经偏离目标,继续走大概率会抓空,我才接手把位置重新对准。 Post Training给人工操作的Takeover Budget只有30秒,我现在不会接管后一直控制,而是只修出问题的那几步,位置正常以后马上点Return to Policy,把剩下的任务重新交给机器人。 ╭──────────────╮ ▹ 这几秒人工介入留下的就是Correction Data。 我之前会觉得,只要成功把机器人救回来,这段操作多少都有训练价值。 Axis公布的一组实验让我改了这个想法,660条Correction经过筛选,最后只有161条进入训练,大约24%。 ╰──────────────╯ 现在再做Post Training,我关注的已经不只是任务有没有完成。 我会刻意少接手,接手后也尽快还回去,看看Policy能不能从我修正的位置继续完成任务。 ◇ 同样都是把机械臂拉回正确位置,为什么有的Correction最后能留下,有的会被筛掉,这里面还有一套挺具体的判断过程。 后续 我准备顺着660条到161条这条筛选过程继续往下分析。 参与地址:
显示更多
0
127
68
4
转发到社区