🤖 ロボットの器用な手つきも、結局は「データ量」で伸びることが実証されました。
タイトル: GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
URL:
🧩 概要
AgiBot Research Teamが、既存の動画生成モデルを流用せず全コンポーネントをロボット操作データからゼロで学習する「ワールドアクションモデル」GE-Act 2.0を提案しました。未来の視覚状態を予測し、そこから行動を導きます。
⚙️ 解決する課題
既存手法は再構成品質重視の動画生成器をそのまま使っており、行動予測に必要な情報が保証されない上、視覚生成とインバースダイナミクスの事前学習と接続の関係が未解明でした。
🛠 方法論と提案手法
64倍圧縮の行動特化オートエンコーダ(CoAE)、1回の順伝播で未来映像を生成するSingle-Step Visual Planner、視覚予測と実行動のズレ(妥当性ギャップ)をtop-k選択で解消するKASOという3つの工夫で構成されています。
📊 実験結果
学習データを300時間から3万時間に増やすと、ロボットG1-OPの成功率は17.1%から44.1%へ27.0ポイント向上。データが2%未満しかないG2-90Dでも17.7ポイント向上し、身体をまたいだ知識転移が確認されました。物体・色・位置の指示追従も90%以上の精度を達成しています。
#
ロボティクス# #
世界モデル#