登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 embodied
embodied コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
embodied を含む検索結果
🕶️ 自分の体の動きで一人称の世界を歩き回り、しかも「特定の場所に何があるか」を画像とポーズで指定して時間変化まで作れる——身体性のある一人称世界モデルAnchorWorldです。 タイトル: AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization URL: 📝 概要 AnchorWorldは、人間の全身モーションで操作する一人称動画を生成する世界モデルです。さらに「アンカービュー」で、特定の3D位置に何が存在し、どう時間変化するかを明示的に指定できます。 ❓ 解決する課題 既存の世界モデルは、一人称動画だけでは全身モーションの教師付けが難しく、環境も暗黙的にしか定義できませんでした。「自然な身体操作」と「局所的な世界カスタマイズ」の両方が欠けていたのです。 💡 方法論と提案手法 ・一人称では体の多くが見えないため、三人称動画を補助教師に使い、全身と環境の位置関係を学習します ・アンカーはRGB画像・6-DoF視点ポーズ・進化プロンプトの3要素で、特定位置の見た目と時間変化を指定します ・3D RoPEで複数アンカーを空間的に区別し、masked cross-attentionでアンカーごとのテキスト制御を実現します ・三人称→一人称→静的アンカー→動的進化、の4段階で段階的に学習します(Wan 2.2 TI2V 5B上に構築) 🎯 ユースケース VRの身体性アプリ、一人称ゲームの環境設計、身体性AIの学習シナリオ、局所制御つきのインタラクティブ動画生成などに使えます。 📊 実験結果 ・一人称静的シーンでCLIP-V 0.885、カメラ精度ATE 0.112mとPlayerOneなどを上回りました ・一人称動的シーンのテキスト整合(VideoAlign-TA)は0.717で、CaM-Egoの0.385を大きく超えました ・分布外のUEシーンや実世界でも、初期ビューとアンカーの重なりが少ない条件で強い汎化を示しました #WorldModel# #EmbodiedAI#
もっと見る
🤖 ロボットが「行動する」だけでなく「考えて」「未来を予測してから動く」ようになったら何が変わるでしょうか。37,000時間超のデータで訓練された体現型基盤モデルの発表です。 タイトル: GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture URL: GigaBrain-0.7は、理解・予測・行動を明確に分離しつつ統合する三システムアーキテクチャを提案しています。注目ポイントは次の3つです。 🧠 System 2: 理解と計画 PaliGemma2(3B)をベースに、現在の視覚シーンと長期指示を解釈し、chain-of-thought推論で「ハンガーに掛ける」を「まず赤い帽子を拾う」のように部分タスクへ分解します。 🔮 System 3: 予測と評価 GigaWorld-1ベース(5B)で将来の視覚状態を動画として予測し、最終フレームを「サブゴール画像」として抽出。同時にタスク進捗をスコア化し、行動を導く評価信号として活用します。 🦾 System 1: 行動と制御 Mixture-of-Transformers構成で連続行動チャンクを生成。16種類のロボット形態に対応する統一embodiment表現により、マルチロボットでの汎用性を実現しています。 大規模な事前学習を進めるほど検証損失が一貫して下がり、創発的な体現能力の兆しが見えてきた点が印象的です。 #ロボティクス# #身体性AI#
もっと見る
🤖 知覚も、計画も、実行も、失敗からの立て直しも、全部ひとつのモデルで。たった8BでGPT-5.4を超えるロボット基盤モデルが登場しました。 タイトル: Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models URL: 📝 概要 Embodied-R1.5は、身体的認知・タスク計画・誤り修正・pointingを単一アーキテクチャに統合したEmbodied Foundation Model(EFM)です。タスクごとに専用モデルを作る従来路線から脱却し、汎用的な物理知能を目指します。 🧩 解決する課題 ロボットAIには知覚・推論・計画・実世界での実行が必要ですが、これまでは個別タスクごとに別モデルを用意するのが普通でした。本研究はそれらを1つに束ね、長い時間軸のタスクを自律的にこなすことを狙います。 🛠 方法論・提案手法 ・15B超トークンを自動生成するデータ構築パイプライン ・異種タスクの衝突を抑えるマルチタスク・バランス型の強化学習レシピ ・Planner→Grounder→Correctorのクローズドループ(PGC)で自律実行と自己修正を実現 📊 実験結果 ・8Bパラメータで24の身体ベンチマーク中16でSOTA、Gemini-Robotics-ER-1.5やGPT-5.4を上回る ・4つの操作スイートでπ0.5を上回る ・実ロボットでも強い汎化を確認 🎯 ユースケース 重み・データ・学習コードに加え、評価フレームワークEmbodiedEvalKitもオープンソース化。ロボット操作や長時間タスクの自律実行・自己修正の研究基盤として使えそうです。 #EmbodiedAI# #Robotics#
もっと見る
道案内AIが路地の角を曲がれても、都市を横断できるとは限りません。その差を実スケールの香港で測りました。 UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 🏙️ 概要 MLLMは短距離タスクや視覚認識で高い性能を示してきましたが、「局所での強さが広域行動に転化するか」は未検証でした。UrbanGroundは、香港の地理空間データ(OSM・衛星地図)からUnity上に構築した実スケール3D都市シミュレーションで、MLLMの空間エージェント能力を体系的に評価します。810件の人手検証済みタスクを5段階の評価ラダーに配置しています。 🔍 解決する課題 既存の空間推論ベンチマークはほとんどが小規模・合成環境・短距離タスクに留まっており、都市スケールの複合的な空間推論を問うものがありませんでした。天候変動・道路閉鎖・歩行者群衆といった動的変化への対応も問われていませんでした。 ⚙️ 方法論 フレームワークは3層構成(地理空間層・シミュレーション層・エージェント層)で、エージェントは一人称視点映像とインタラクティブマップを入力として受け取ります。評価は5段階ラダーで段階的に複雑化します。 ・Level 1: 視覚認識・方向判断・能動的探索 ・Level 2: 短距離/長距離/指示付きナビゲーション ・Level 3: 説明文からの暗黙的目的地推論 ・Level 4: スケジューリング・経路最適化 ・Level 5: 道路閉鎖・歩行者への動的適応 📊 実験結果 視覚認識は77〜93%と比較的高い一方、方向判断は23〜58%と弱く、短距離ナビゲーション成功率〜70%が長距離ではほぼゼロに崩壊します。天候・照明変化でQA精度が5〜20ポイント低下し、歩行者との衝突率は全モデルで75%超でした。GPT-5.5とKimi-K3が最も強力でしたが、長距離・動的環境での失敗パターンはどのモデルも同様です。 核心的知見は「局所能力は広域探索に合成されない」こと。エージェントは目に見える範囲は適切に動けても、それを超えた空間状態の維持や無効ルートの計画修正ができないことが実証されました。 #MLLMs# #EmbodiedAI#
もっと見る
ロボットが初めて「Wine Bottle in Bowl」を学習したとき、成功率はわずか 15% だった。それがある閾値を超えた瞬間、95% へと跳ね上がる。これはモデルを再訓練したからではない。コードで書かれた「観察と介入の仕組み」が、自ら進化したからだ。 これまでの VLA(Vision-Language-Action)モデルはオープンループだった。ロボットが失敗しても、次のエピソードが終わるまでフィードバックがない。人間がログを見て、パラメータを手動で調整する。そのサイクルは遅く、スケールしない。小さな外乱が連鎖的な失敗へと積み重なっても、システムはそれをリアルタイムで捉えられなかった。 Zetta ζ はその問題を3つの時間スケールで解きます。実行中は高頻度のクリティックが軌跡を監視し、衝突の芽を摘む(アクションレベル)。失敗したエピソードはシグネチャでクラスタリングされ、6層の因果診断でボトルネックを特定してハーネスを最小限に修正する(エピソードレベル)。そして未知の環境でも汎化したスキルだけが、バリデーションゲートを通ってスキルメモリへ永続登録される(イテレーションレベル)。 ベースモデルの重みは一切変えません。進化するのはコードとしてのハーネスだけ。LIBERO-Pro で 34.5% → 90.8%、RoboCasa で 73.6% → 93.6%。推論速度は RPent 比 11.1 倍。スループットは 1.7 → 35.1 エピソード/分(20.6 倍)へ。学習したスキルは PnP-Sink・PnP-Cabinet・PnP-Toaster でゼロショット転移に成功しました。 Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence #EmbodiedAI# #ロボティクス#
もっと見る
「物理世界モデル」の新アプローチ——ピクセルを予測する前に「世界がどう変化するか」を言語として推論します。 タイトル: PhiZero: A World Model Built Around Physical Language ❓ 「物理言語(Physical Language)」とは何ですか? 💡 動画の状態遷移パターンを離散的なトークン列として直接表現する新しい中間表現です。外観(見た目)と動力学(動き方)を分離して学習するため、ソース動画の状態遷移を全く別の視覚スタイルに転送できます。PhiZeroはこの「物理言語」を推論してから動画を生成する「Reason-then-render」パラダイムを実現します。 ❓ 従来の物理世界モデルはなぜ物理的に不自然だったのですか? 💡 ピクセル空間での直接予測に頼っていたため、動力学がモデル内部に暗黙的に埋め込まれ、見た目のリアルさと物理的整合性の両立が困難でした。テニスボールがゴムアヒルに当たってもアヒルが反応しないような物理的矛盾が生じやすく、推論過程も不透明でした。 ❓ 具体的にどんな性能を達成しましたか? 💡 6つのベンチマーク全てで最高水準の結果を出しました。 ・Physics-IQ IQ-Score:41.2(前SOTA 39.5を更新) ・WorldModelBench 物理準拠・常識・総合で全て最高スコア ・因果関係理解YoCausal:集約ランク2.0(最高) ・トークナイザーはわずか256トークンでPSNR 28.9の高品質再構成を実現(Wan2.2-5B VAEの175分の1) ❓ ロボティクスや自動運転への応用はどうなりますか? 💡 物理言語は外観に依存しない遷移表現なので、シミュレーション→実世界(Sim-to-real)や人間→ロボットへのゼロショット転送が実現します。LIBERO シミュレーション動画の物理言語を保存し、リアルな映像で再生したり、人間の動作パターンをロボットに直接適用する実験が成功しています。 #WorldModel# #EmbodiedAI#
もっと見る
🗺️ 最先端のGPT-5でも、現実世界の空間タスクの成功率はわずか14.4%——。静止画を眺めて答えるだけでは測れない、AIエージェントの「能動的な空間推論」の弱さをあぶり出す新しいベンチマークが登場しました。 タイトル: SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks URL: 📝 概要 SpatialWorldは、マルチモーダルLLMが視覚のみの一人称視点で、3D環境を能動的に探索しながらタスクを解けるかを測るベンチマークです。屋内・屋外・デジタルゲームにわたる8つの異なるシミュレータを共通プロトコルで統合し、人手で作った760タスクで15の最先端モデルを評価しました。エージェントは事前に与えられた地図や正解の手順なしに、自分で見て、動いて、判断する必要があります。 ❓ 解決する課題 従来の空間推論ベンチマークは、静的なVQAや録画済み動画による受動的な評価に依存していました。しかしこれでは、エージェントが自ら視点を動かして視覚的な証拠を集め、部分的にしか見えない状況の中でその場で計画を立て直す、という現実世界に必要なインタラクティブな空間理解を測れません。静的なシーンを認識できることと、未知の空間で実際に動いて課題を解けることの間には、大きな隔たりがあったのです。 💡 方法論と提案手法 ・課題を視覚のみのPOMDP(部分観測マルコフ決定過程)として定式化します ・エージェントは自然言語のゴールと、ネイティブ解像度の一人称RGB画像1枚だけを受け取り、深度・地図・意味メタデータは一切与えられません ・行動はナビゲーション、視点制御、物体とのインタラクション、タスク完了を含むテキストベースの高レベルインターフェースで指示します ・屋内(AI2-THOR、ProcTHOR、VirtualHome)、屋外(CARLA、EmbodiedCity)、デジタルゲーム(Block3D、Snake3D、ルービックキューブ)の8バックエンドを統合します ・評価は途中の軌跡の一致ではなく、最終的な終端状態がゴールを満たしたかで判定し、人手で妥当性を確認します ・成功率に加え、人間の参照軌跡と比べたステップ効率も測ることで、効率の悪さも可視化します 🎯 ユースケース 家庭用ロボットや自律エージェントの空間能力を、実環境へ配備する前に統一的かつ公平に評価する基盤になります。ナビゲーションと物体操作を組み合わせた長期タスクのどこでつまずくのかを体系的に診断でき、空間推論モデルの改善に向けた厳密なテストベッドとして活用できます。 📊 実験結果 ・15の最先端モデルを評価し、物理タスクの成功率はGPT-5が14.4%、Qwen-3.5-397Bが12.2%、Gemini-3.1-Proが9.2%、Kimi-K2.5が9.2%にとどまりました ・デジタルゲームではGemini-3.1-Proが39.0%で最高、GPT-5が36.4%と続きました ・複雑さ別に見ると、インタラクションのみのタスクは平均50.2%だったのに対し、ナビゲーションのみは8.6%、両者を組み合わせた複合タスクはわずか4.2%まで急落しました ・成功率が近いモデルどうしでも効率スコアは大きく異なり、多くのモデルが試行錯誤に頼って動いている実態が明らかになりました ・環境ごとにモデルの順位が大きく入れ替わり、全カテゴリを支配する万能なモデルは存在しませんでした #AIエージェント# #SpatialReasoning#
もっと見る