🤖 高価なロボット実演データの不足を、私たちの「一人称視点の日常動画」で補う。人間の手の動きをロボットの行動に変換してVLAを学習させる研究です。
📰 タイトル: ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining
🔗 URL:
💡 概要
ロボットの実演データと、Ego4DやEPIC-KITCHENSのような一人称視点の人間動画を統一して、Vision-Language-Action(VLA)モデルを事前学習する枠組み「ACE-Ego-0」の提案です。合計6,000時間超のデータで学習しています。
🔍 解決する課題
ロボット実演の収集は高コストですが、人間動画は安価で豊富です。ただし両者は行動空間・身体構造・時間の進み方・教師信号の品質がバラバラで、素朴に混ぜると学習が壊れてしまう点が課題でした。
🛠 方法論と提案手法
・行動を頭部カメラ座標系の6D回転で統一表現し、人間の手もエンドエフェクタとして扱う
・ロボットのURDFをGNNでモルフォロジートークン化し構造差を吸収
・固定ステップでなく一定の物理時間でチャンク分割して時間を整列
・ノイジーな人間動画には信頼性重み付け損失を適用し、信頼できる位置情報に集中
📊 ユースケース / 実験結果
シミュレーションのRoboCasaで平均72.8%(GR00T-N1.6の47.6%を大きく上回る)、RoboTwin 2.0で約91%を達成。実機の両腕ロボットでも平均78.3%(π0.5は71.7%)。特にロボット実演34件しかないタスクで、人間動画419本を足すと成功率が10%→40%へと4倍に改善しました。
#
ロボット学習# #
VLA#