登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 EgocentricAI
EgocentricAI コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
EgocentricAI を含む検索結果
🕶️ 自分の体の動きで一人称の世界を歩き回り、しかも「特定の場所に何があるか」を画像とポーズで指定して時間変化まで作れる——身体性のある一人称世界モデルAnchorWorldです。 タイトル: AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization URL: 📝 概要 AnchorWorldは、人間の全身モーションで操作する一人称動画を生成する世界モデルです。さらに「アンカービュー」で、特定の3D位置に何が存在し、どう時間変化するかを明示的に指定できます。 ❓ 解決する課題 既存の世界モデルは、一人称動画だけでは全身モーションの教師付けが難しく、環境も暗黙的にしか定義できませんでした。「自然な身体操作」と「局所的な世界カスタマイズ」の両方が欠けていたのです。 💡 方法論と提案手法 ・一人称では体の多くが見えないため、三人称動画を補助教師に使い、全身と環境の位置関係を学習します ・アンカーはRGB画像・6-DoF視点ポーズ・進化プロンプトの3要素で、特定位置の見た目と時間変化を指定します ・3D RoPEで複数アンカーを空間的に区別し、masked cross-attentionでアンカーごとのテキスト制御を実現します ・三人称→一人称→静的アンカー→動的進化、の4段階で段階的に学習します(Wan 2.2 TI2V 5B上に構築) 🎯 ユースケース VRの身体性アプリ、一人称ゲームの環境設計、身体性AIの学習シナリオ、局所制御つきのインタラクティブ動画生成などに使えます。 📊 実験結果 ・一人称静的シーンでCLIP-V 0.885、カメラ精度ATE 0.112mとPlayerOneなどを上回りました ・一人称動的シーンのテキスト整合(VideoAlign-TA)は0.717で、CaM-Egoの0.385を大きく超えました ・分布外のUEシーンや実世界でも、初期ビューとアンカーの重なりが少ない条件で強い汎化を示しました #WorldModel# #EmbodiedAI#
もっと見る
🤖 高価なロボット実演データの不足を、私たちの「一人称視点の日常動画」で補う。人間の手の動きをロボットの行動に変換してVLAを学習させる研究です。 📰 タイトル: ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining 🔗 URL: 💡 概要 ロボットの実演データと、Ego4DやEPIC-KITCHENSのような一人称視点の人間動画を統一して、Vision-Language-Action(VLA)モデルを事前学習する枠組み「ACE-Ego-0」の提案です。合計6,000時間超のデータで学習しています。 🔍 解決する課題 ロボット実演の収集は高コストですが、人間動画は安価で豊富です。ただし両者は行動空間・身体構造・時間の進み方・教師信号の品質がバラバラで、素朴に混ぜると学習が壊れてしまう点が課題でした。 🛠 方法論と提案手法 ・行動を頭部カメラ座標系の6D回転で統一表現し、人間の手もエンドエフェクタとして扱う ・ロボットのURDFをGNNでモルフォロジートークン化し構造差を吸収 ・固定ステップでなく一定の物理時間でチャンク分割して時間を整列 ・ノイジーな人間動画には信頼性重み付け損失を適用し、信頼できる位置情報に集中 📊 ユースケース / 実験結果 シミュレーションのRoboCasaで平均72.8%(GR00T-N1.6の47.6%を大きく上回る)、RoboTwin 2.0で約91%を達成。実機の両腕ロボットでも平均78.3%(π0.5は71.7%)。特にロボット実演34件しかないタスクで、人間動画419本を足すと成功率が10%→40%へと4倍に改善しました。 #ロボット学習# #VLA#
もっと見る