Register and share your invite link to earn from video plays and referrals.

拳头👊🕊️
@pvyyu42928466
TGE 追踪|撸毛实测|Web3 项目投研 AI 模型与 Agent 工具测评 筛选信息,拆解机制,只分享经过验证的判断
Joined October 2023
12.5K Following    15.4K Followers
这次我想把Post Training里那几秒人工接管再往下拆一层。 @axisrobotics 公开的实验任务,是让机械臂把一块豆腐放到盘子里,Policy先自己执行,出现失败趋势时由人短暂接手,修正后再把控制权交还给Policy。 这里的Correction不是完整示范,而是截取Policy出错位置附近的恢复动作。 ▣ 实验最初收集了660条Correction,第一关是Replay Check,整段操作需要在模拟环境里重新执行并完成任务,660条里有496条通过。 后面还要确认人工接管并非多余,经过Redundancy Filter后剩下416条,其中414条满足短片段测试条件。 到了Recovery Test,人工只修那一小段,控制权重新交回Policy,机器人还要能继续把任务做完。 真正留下的只有161条,平均每段约0.8秒。 ◇ 这套筛选也改变了我的操作习惯。 有一次夹爪已经蹭到物体边缘,我接手后只往侧面调整了一点,把夹爪重新对准目标,确认位置没问题后就点Return to Policy,让机器人自己完成后面的抓取和移动。 ▹ 161条Correction进入训练后,Axis用同一批160个起始状态测试新旧Policy,原Policy完成66次,三次训练分别完成78次,80次和84次。 官方结果能确认完成次数增加,但没有单独拆出具体减少了哪一类失败,我更愿意把它看成Policy整体任务成功表现得到改善。 另一组480个新起始状态里,原Policy完成192次,直接学习完整人类轨迹后降到176次。 换成经过验证的短Correction,Axis还比较了40条,80条和161条三个规模,随着有效修正增加,整体表现继续改善,161条版本三次分别完成236次,235次和225次。 ◈ 现在再看这套机制,我发现Axis筛选Correction时,看的是这段修正到底解决了什么问题,而不是单纯看它持续了多久。 先Replay确认任务能够完成,再判断接管是否发生在Policy确实无法处理的位置,还要经过Recovery Test,验证修正后机器人能否自己继续完成任务。三层筛选都通过,这段Correction才会被留下。 模拟环境里的效果已经有数据支撑,下一篇我想把视线转到真实机械臂上,看看这些经过筛选的修正离开浏览器以后还能不能继续发挥作用。 实验数据来源
Show more