登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 WorldModel
WorldModel コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
WorldModel を含む検索結果
「物理世界モデル」の新アプローチ——ピクセルを予測する前に「世界がどう変化するか」を言語として推論します。 タイトル: PhiZero: A World Model Built Around Physical Language ❓ 「物理言語(Physical Language)」とは何ですか? 💡 動画の状態遷移パターンを離散的なトークン列として直接表現する新しい中間表現です。外観(見た目)と動力学(動き方)を分離して学習するため、ソース動画の状態遷移を全く別の視覚スタイルに転送できます。PhiZeroはこの「物理言語」を推論してから動画を生成する「Reason-then-render」パラダイムを実現します。 ❓ 従来の物理世界モデルはなぜ物理的に不自然だったのですか? 💡 ピクセル空間での直接予測に頼っていたため、動力学がモデル内部に暗黙的に埋め込まれ、見た目のリアルさと物理的整合性の両立が困難でした。テニスボールがゴムアヒルに当たってもアヒルが反応しないような物理的矛盾が生じやすく、推論過程も不透明でした。 ❓ 具体的にどんな性能を達成しましたか? 💡 6つのベンチマーク全てで最高水準の結果を出しました。 ・Physics-IQ IQ-Score:41.2(前SOTA 39.5を更新) ・WorldModelBench 物理準拠・常識・総合で全て最高スコア ・因果関係理解YoCausal:集約ランク2.0(最高) ・トークナイザーはわずか256トークンでPSNR 28.9の高品質再構成を実現(Wan2.2-5B VAEの175分の1) ❓ ロボティクスや自動運転への応用はどうなりますか? 💡 物理言語は外観に依存しない遷移表現なので、シミュレーション→実世界(Sim-to-real)や人間→ロボットへのゼロショット転送が実現します。LIBERO シミュレーション動画の物理言語を保存し、リアルな映像で再生したり、人間の動作パターンをロボットに直接適用する実験が成功しています。 #WorldModel# #EmbodiedAI#
もっと見る
🕶️ 自分の体の動きで一人称の世界を歩き回り、しかも「特定の場所に何があるか」を画像とポーズで指定して時間変化まで作れる——身体性のある一人称世界モデルAnchorWorldです。 タイトル: AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization URL: 📝 概要 AnchorWorldは、人間の全身モーションで操作する一人称動画を生成する世界モデルです。さらに「アンカービュー」で、特定の3D位置に何が存在し、どう時間変化するかを明示的に指定できます。 ❓ 解決する課題 既存の世界モデルは、一人称動画だけでは全身モーションの教師付けが難しく、環境も暗黙的にしか定義できませんでした。「自然な身体操作」と「局所的な世界カスタマイズ」の両方が欠けていたのです。 💡 方法論と提案手法 ・一人称では体の多くが見えないため、三人称動画を補助教師に使い、全身と環境の位置関係を学習します ・アンカーはRGB画像・6-DoF視点ポーズ・進化プロンプトの3要素で、特定位置の見た目と時間変化を指定します ・3D RoPEで複数アンカーを空間的に区別し、masked cross-attentionでアンカーごとのテキスト制御を実現します ・三人称→一人称→静的アンカー→動的進化、の4段階で段階的に学習します(Wan 2.2 TI2V 5B上に構築) 🎯 ユースケース VRの身体性アプリ、一人称ゲームの環境設計、身体性AIの学習シナリオ、局所制御つきのインタラクティブ動画生成などに使えます。 📊 実験結果 ・一人称静的シーンでCLIP-V 0.885、カメラ精度ATE 0.112mとPlayerOneなどを上回りました ・一人称動的シーンのテキスト整合(VideoAlign-TA)は0.717で、CaM-Egoの0.385を大きく超えました ・分布外のUEシーンや実世界でも、初期ビューとアンカーの重なりが少ない条件で強い汎化を示しました #WorldModel# #EmbodiedAI#
もっと見る
World modelで興味深いのは、研究デモから実インフラへ移り始めた点です。Googleは2026年1月、Genie 3を「Project Genie」として一般提供を開始しました。さらにWaymoはGenie 3を改造した独自World modelで、自動運転のレアケースを生成し学習に使っています。世界を「作る」AIが、現実の訓練を支え始めています。
もっと見る
「World model」という言葉、今いろんな意味で使われすぎてて要注意。 ざっくり整理すると ・Genie3みたいに生成して遊べる3D世界 ・V-JEPAみたいに抽象表現で予測する潜在モデル ・自動運転の物理シミュレータ ・ゲームから学ぶモデル 同じ単語でも、指してる中身は全然違う。
もっと見る
World modelの賭けはシンプルだ。テキストの次の単語を当てるLLMでは、物理を理解する知能には届かない、というもの。LeCunはこの主張でメタを辞め、約1500億円を集めた。ピクセルじゃなく抽象表現で世界の動きを予測する。言葉の外に知能はあるか、が論点だ。
もっと見る
World modelがLLMを置き換える、と盛り上がってるけど、少し冷静になった方がいい。巨額の資金は動いてるが、実用的な製品はまだ数年先という見方が普通。提唱側のCEO自身が「半年で各社がworld modelを名乗り出す」と言ってるくらいだ。バズワード化には用心したい。
もっと見る
操作に応じて映像を生み出す「動画ワールドモデル」、その実力を公平に測る統一ベンチマークが登場しました🎮 タイトル: WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation URL: 🎮 概要 インタラクティブな動画ワールドモデルを包括的に評価する統一フレームワークです。289テストケース・1,058インタラクションターンで、テキスト・6-DoF姿勢・離散アクションという異なる操作方式のモデルを同じ土俵で比較できます。 ❓ 解決する課題 インタラクティブなワールドモデルは急速に進歩する一方、能力を体系的に測る基準がありませんでした。既存ベンチマークは一部しかカバーできず、入力方式がモデルごとに違うため横並び比較も困難でした。 💡 方法論と提案手法 評価は5つの次元で行います。 ・映像品質 ・設定への忠実性 ・インタラクションへの忠実性 ・一貫性 ・物理法則への整合性 タスクはナビゲーション・被写体アクション・イベント編集・視点切り替えの4種。専門視覚モデルと大規模マルチモーダルモデルを組み合わせた22の自動指標を、人間の判断と照合して検証しています。 📊 実験結果 最先端20モデルを分析した結果、すべての次元で強いモデルは1つも存在しないことが判明。各アプローチに特徴的な強み・弱みと、共通の難題が浮かび上がりました。 #ワールドモデル# #ベンチマーク#
もっと見る
Tencentのロボティクスチームが、ロボットに「言葉で考えて、絵で確かめながら動く」能力を持たせる基盤モデル「RxBrain」を発表した(https://arxiv[.]org/abs/2607.14187)。 例えば「メガネを畳んでケースにしまう」というタスクなら、RxBrainは「つるを畳む」「ケースに入れる」と言葉で手順を計画し、それぞれの手順を終えた後の映像がどう見えるはずかを画像として想像しながらタスクを進めていく。 背景には、ロボット向けAIが抱えていた分業の問題がある。視覚言語モデル(VLM、画像を見て言葉で答えを返すAI)は「次に何をすべきか」の説明は得意だが結果の見た目までは示さず、逆に世界モデル(world model、未来の映像を予測するAI)は先の状態を絵で示せてもなぜそうすべきかという理由づけは苦手だった。RxBrainは6.2Bパラメータの単一モデルの中で、この2つの機能をMixture-of-Transformers(データの種類ごとに専門の処理経路を用意しつつ注意機構だけは共有するアーキテクチャ)で統合している。 学習データは実ロボットの操作映像、ハンドヘルドグリッパーでの人の動作、一人称視点の日常動画などから自動構築した5万時間超・2150万セグメント。新設ベンチマークRxBrain-Benchの「言葉と画像を組み合わせた計画」タスクではスコア0.68を記録し、既存のエージェント型手法(BAGEL-7B-MoTが0.50、Qwen-Agentが0.43)を上回った。一方、単純な状況理解を問うタスクでは総合スコア72.7にとどまり、Qwen3.5-4B(78.1)には及ばない。先を見通した計画は得意でも、細かい状況認識はまだ既存モデルに一歩譲るというバランスが見える。 さらに、大規模な行動データでの事前学習なしに実ロボットへ応用した結果も興味深い。食卓の準備・メガネの折りたたみ収納・ゴミ捨ての3タスクで平均成功率87%を達成し、ロボット操作の代表的な基盤モデルπ0.5(82%)やπ0(68%)を上回った。 「言葉で考え、絵で確かめる」というアプローチで、ロボットの計画立案を人間の思考プロセスに近づけようとしている点が面白い。
もっと見る
🌍 「自己教師あり学習はいつ世界の真の構造を復元できるのか?」——その答えが“潜在変数がガウス分布のときだけ”だと数学的に証明した、LeCunらの理論研究です。 タイトル: When Does LeJEPA Learn a World Model? URL: 💡 概要 LeJEPA(JEPA+ガウス正則化SIGReg+アライメント)が、非線形な観測から世界の潜在変数を「回転を除いて線形に」復元できる条件を理論的に解明しました。鍵は潜在がガウス分布でOU過程に従うことです。 ⚠️ 解決する課題 表現が世界の真の自由度を歪めると、信頼できる計画や構成的汎化ができません。自己教師あり学習がいつ世界構造を証明可能に復元するのかは未解明でした。 🛠 方法論と核心 ・最適表現は潜在過程の「最も遅い特徴」を固有値順に抽出する ・エルミート多項式とMehlerの公式により、ビュー間相関は非線形の次数dに対しρ^dで減衰 ・つまりアライメントはあらゆる非線形性を罰し、線形写像が唯一の最適解になる ・線形可識別性が成り立てば、潜在空間での計画は真の世界と同一の最適行動を返す(制御にそのまま使える) ・逆に「常に線形最適」を要求すると潜在分布はガウスでなければならない(唯一性) 📊 実験結果 ・SIGRegとVICRegは1024次元までR²>0.999で線形復元 ・一般化正規分布の掃引でR²はα=2(ガウス)で鋭くピーク ・ピクセルからのロボット制御ではガウスOUでR²=0.95、非ガウスな実軌跡はR²≤0.5 ・制御コストはR²と単調に連動し、ガウス符号化器はオラクル級 #世界モデル# #自己教師あり学習#
もっと見る