登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 pretraining
pretraining コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
pretraining を含む検索結果
🤖 ロボットの器用な手つきも、結局は「データ量」で伸びることが実証されました。 タイトル: GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation URL: 🧩 概要 AgiBot Research Teamが、既存の動画生成モデルを流用せず全コンポーネントをロボット操作データからゼロで学習する「ワールドアクションモデル」GE-Act 2.0を提案しました。未来の視覚状態を予測し、そこから行動を導きます。 ⚙️ 解決する課題 既存手法は再構成品質重視の動画生成器をそのまま使っており、行動予測に必要な情報が保証されない上、視覚生成とインバースダイナミクスの事前学習と接続の関係が未解明でした。 🛠 方法論と提案手法 64倍圧縮の行動特化オートエンコーダ(CoAE)、1回の順伝播で未来映像を生成するSingle-Step Visual Planner、視覚予測と実行動のズレ(妥当性ギャップ)をtop-k選択で解消するKASOという3つの工夫で構成されています。 📊 実験結果 学習データを300時間から3万時間に増やすと、ロボットG1-OPの成功率は17.1%から44.1%へ27.0ポイント向上。データが2%未満しかないG2-90Dでも17.7ポイント向上し、身体をまたいだ知識転移が確認されました。物体・色・位置の指示追従も90%以上の精度を達成しています。 #ロボティクス# #世界モデル#
もっと見る
🤖 高価なロボット実演データの不足を、私たちの「一人称視点の日常動画」で補う。人間の手の動きをロボットの行動に変換してVLAを学習させる研究です。 📰 タイトル: ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining 🔗 URL: 💡 概要 ロボットの実演データと、Ego4DやEPIC-KITCHENSのような一人称視点の人間動画を統一して、Vision-Language-Action(VLA)モデルを事前学習する枠組み「ACE-Ego-0」の提案です。合計6,000時間超のデータで学習しています。 🔍 解決する課題 ロボット実演の収集は高コストですが、人間動画は安価で豊富です。ただし両者は行動空間・身体構造・時間の進み方・教師信号の品質がバラバラで、素朴に混ぜると学習が壊れてしまう点が課題でした。 🛠 方法論と提案手法 ・行動を頭部カメラ座標系の6D回転で統一表現し、人間の手もエンドエフェクタとして扱う ・ロボットのURDFをGNNでモルフォロジートークン化し構造差を吸収 ・固定ステップでなく一定の物理時間でチャンク分割して時間を整列 ・ノイジーな人間動画には信頼性重み付け損失を適用し、信頼できる位置情報に集中 📊 ユースケース / 実験結果 シミュレーションのRoboCasaで平均72.8%(GR00T-N1.6の47.6%を大きく上回る)、RoboTwin 2.0で約91%を達成。実機の両腕ロボットでも平均78.3%(π0.5は71.7%)。特にロボット実演34件しかないタスクで、人間動画419本を足すと成功率が10%→40%へと4倍に改善しました。 #ロボット学習# #VLA#
もっと見る