가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Nono_小鱼饼饼
@BubbleBing_666
一条在意水位的小鱼🐟 专注投研 Web3|港美股|AI |蓝鸟会 只游向有机会的地方。TG:BubbleBling @MEXCZH 大使
가입 June 2013
3.3K 팔로잉 중    11.6K 팬
看完 @axisrobotics V2 之后,有个变化我一直觉得挺贴机器人训练本身。 早期收数据的时候,人会完整操作机器人,把一整个任务怎么完成留下来。 等模型自己已经能跑一部分以后,收数据的方式开始变了。先让机器人自己做,快失败的时候人再接管,把它拉回能继续完成任务的位置。 Axis 后面已经收了 500+ 小时这类人工纠正数据。 问题也跟着出来了:人把机器人救回来,不代表整段操作都值得学。 他们后来做的那组实验里,660 条人工纠错最后只有 161 条短片段进了训练。很多看起来“最后成功”的操作,其实中间带着停顿、犹豫、重复调整,整段照着学,模型表现还会掉。 所以现在这条线已经挺清楚了。 前面的大量完整操作负责把任务教会,模型开始自己跑以后,再去找那些经常出错的地方,人只补关键几步。 这个变化我觉得很适合 Axis。 它本来就在做大规模社区数据,数据越多以后,怎么把人力放到模型最需要的地方,会越来越重要。 机器人已经会的东西继续让它自己做,老是做错的地方再让人进去修。 这样才像是在训练一个会慢慢进步的机器人。
더 보기