登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 世界モデル
世界モデル コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
世界モデル を含む検索結果
「物理世界モデル」の新アプローチ——ピクセルを予測する前に「世界がどう変化するか」を言語として推論します。 タイトル: PhiZero: A World Model Built Around Physical Language ❓ 「物理言語(Physical Language)」とは何ですか? 💡 動画の状態遷移パターンを離散的なトークン列として直接表現する新しい中間表現です。外観(見た目)と動力学(動き方)を分離して学習するため、ソース動画の状態遷移を全く別の視覚スタイルに転送できます。PhiZeroはこの「物理言語」を推論してから動画を生成する「Reason-then-render」パラダイムを実現します。 ❓ 従来の物理世界モデルはなぜ物理的に不自然だったのですか? 💡 ピクセル空間での直接予測に頼っていたため、動力学がモデル内部に暗黙的に埋め込まれ、見た目のリアルさと物理的整合性の両立が困難でした。テニスボールがゴムアヒルに当たってもアヒルが反応しないような物理的矛盾が生じやすく、推論過程も不透明でした。 ❓ 具体的にどんな性能を達成しましたか? 💡 6つのベンチマーク全てで最高水準の結果を出しました。 ・Physics-IQ IQ-Score:41.2(前SOTA 39.5を更新) ・WorldModelBench 物理準拠・常識・総合で全て最高スコア ・因果関係理解YoCausal:集約ランク2.0(最高) ・トークナイザーはわずか256トークンでPSNR 28.9の高品質再構成を実現(Wan2.2-5B VAEの175分の1) ❓ ロボティクスや自動運転への応用はどうなりますか? 💡 物理言語は外観に依存しない遷移表現なので、シミュレーション→実世界(Sim-to-real)や人間→ロボットへのゼロショット転送が実現します。LIBERO シミュレーション動画の物理言語を保存し、リアルな映像で再生したり、人間の動作パターンをロボットに直接適用する実験が成功しています。 #WorldModel# #EmbodiedAI#
もっと見る
ゲームの世界モデルはピクセルを直接生成しがちですが、長く回すほど姿勢や幾何がズレていきます。Marionetteは「正確さが要る部分」を潔く手放しました。 タイトル: Marionette: Predicting World States, Rendering Geometry, Painting Appearance URL: 幾何・遮蔽・運動は決定的レンダラーに委ね、ニューラルには見た目だけを描かせる世界モデルです。注目ポイントは3つ。 🎮 注目ポイント1: 明示的な276次元の世界状態を予測 ピクセルではなく、関節・ルート軌跡・回転からなる3D状態を2段階の自己回帰で予測します。制御は行動トークンを上書きするだけ(プレイヤーのボタン押下と同じ)。誤った行動を強制するとポーズが約31%ズレる=制御が確かに効いている証拠です。 📐 注目ポイント2: ゼロパラメータの決定的レンダラー 6つの閉形式演算だけで状態をポーズ制御動画へ変換。ワールド整合性・遮蔽順序・計量スケールが「構成上」保証されます。長期の破綻は、外見モデルを再訓練せず地形コライダーなどのルールで修復でき、貫通を66%削減しました。 🎨 注目ポイント3: 見た目だけを担う動画拡散 Wan2.2-Fun-5Bベースの拡散が、正確な幾何の上に写実的なRGBを合成。予測状態経由でもFVDは831(記録状態799、ピクセル自己回帰は975)で、忠実度の低下は検出されませんでした。 正確さは決定的計算に、見た目はニューラルに。世界モデルの分業の good design です。 #WorldModels# #GameAI#
もっと見る
ロボット操作のビデオ世界モデルで「本当に指定した動作をしているか」を検証できるモデルが登場しました。 DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation Wan2.2-TI2V-5Bを基盤に、初期フレームと言語指示、両腕の行動軌道から将来フレームを高精度に予測するビデオ世界モデルです。WorldArena 2.0 Track 1で31チーム中1位(EWMScore-P: 60.65)を達成しました。 🔷 注目ポイント1: PRoPE — SE(3)を直接アテンションへ注入 行動を汎用トークンに変換する従来手法を捨て、エンドエフェクタの位置・回転行列・グリッパー状態をSE(3)変換としてアテンション機構に直接組み込みます。アームごとにヘッドをパーティションし、Kronecker積でトークンワイズ変換を適用することで、グローバル座標系への依存を排除。制御性スコア98.55という驚異的な数値を叩き出しています。 🔶 注目ポイント2: 深度ブランチ + 物体中心監督で「見た目」以上の精度を RGB損失だけでは表面順序やオブジェクト範囲を制約できないという根本問題に、2段構えで対処します。軽量な深度ブランチ(最後のMブロックを複製した一方向クロスアテンション)が幾何学的整合性を担保し、SAM3マスクと凍結V-JEPAティーチャーのグラム行列制約が操作物体の時間的一貫性を保ちます。静的背景が大きなロボット映像において、接触近傍のエラーを損失関数に確実に反映させる仕組みです。 🟣 注目ポイント3: DMD蒸留で多ステップを少ステップへ KL divergenceと非飽和GAN損失を組み合わせた分布マッチング蒸留(DMD)により、推論時のステップ数を大幅に削減。Ego4D・AgiBot World 2026・RoboTwin 2.0など合計約6,000時間超の多様なデータで学習されており、広範な視覚事前知識と行動接地の両立を実現します。 ロボット世界モデルがついに「リアルに見える」から「正確に動く」へ進化した一歩です。 #ロボティクス# #世界モデル#
もっと見る
リアルタイム世界モデルは、どの業界から実務化されるか? @reactorworldのLingbot-World-2は、画像とプロンプトを起点に、操作可能な世界をリアルタイム生成。 世界観テストや、空間の体験設計など「中に入って確かめる」ことが優位に働く領域からなのかもしれません。
もっと見る
これ流石に世界モデル的な動きしちゃってる気がするな
【📢受講生募集開始|世界モデル Deep Learning 応用講座 2026】 本日より、「世界モデル Deep Learning 応用講座 2026」の受講生募集を開始しました。 「世界モデル」は、AIエージェントを取り巻く環境のモデルを、観測から学習によって獲得する枠組みです。 近年では、動画生成やロボティクス、AIエージェントなどにもつながる技術として注目を集めています。 本講座では、世界モデルを軸に、 🔹深層生成モデル・潜在表現 🔹モデルベース強化学習 🔹状態表現・潜在予測モデル(JEPA) 🔹3D表現・動画生成 など、基礎となる技術から最新の手法まで体系的に学びます。 さらに、講義内容に対応した実践的な演習を通じて、実際に手を動かしながら最新技術への理解を深めます。世界モデルに関するコンペティションも複数回開催予定で、講座後半ではグループで最終課題にも挑戦します。 📚全12回|毎週月曜 18:45〜20:30 💻完全オンライン(Zoom) 📅開講:11/2(月)〜2027/2/1(月) 🎓対象:学生(深層学習の基礎知識・実装経験がある方) 📅ID登録・学年更新締切:10/16(金)14:00 📅申込締切:10/20(火)14:00 世界モデルを研究・開発に活かしたい学生の方、Physical AIや次世代のAI技術に関心のある方は、ぜひご応募ください! ▼詳細・お申し込みはこちら
もっと見る
1時間以上のインタラクティブ世界を、単一GPUで生成し続けられる——そんな世界モデルが登場しました。 Alaya-EVOKE: From Linear-Scaling Supervision to Endless World 動画世界モデルの核心技術を3つに絞り込み、徹底的に深掘りします。 🗺 注目ポイント1:外部幾何学メモリによるO(1)コンテキスト 従来の世界モデルは生成が長くなるほどトランスフォーマーの文脈長が爆発し、実質的に数分が限界でした。EVOKEは生成フレームから単眼深度推定を行い、カメラポーズでインデックスした「ワールドステートバンク」に3D点群として外部保存します。次チャンク生成時はバンクから必要な幾何学情報を検索してデノイザーに注入するため、セッションが65分を超えても各コールの入力サイズは1.5秒(9フレーム)のまま一定です。「セッション長は再帰コールの回数のみを増やし、各コールのコンテキスト長は一切増やさない」という設計が鍵です。 🎓 注目ポイント2:監督ホライゾンと勾配ホライゾンの分離 長期的な一貫性には長いホライゾンで監督する必要がありますが、バックプロパゲーションのメモリが問題でした。EVOKEは14B Wan2.2教師モデルを設計し、「教師は完全軌跡を評価するが、学生の勾配計算はチャンクごとに切り離す」という手法で解決します。制御実験では、長ホライゾン教師(30秒監督)の学生は輝度が101%で安定、短ホライゾン教師の学生は74%に下落(Wilcoxon p=0.016)。長い教師監督が長期一貫性の「要」であることが統計的に証明されました。 ⚡ 注目ポイント3:CFGなし3ステップ推論でVBench-2.0首位 CFG(Classifier-Free Guidance)を一切使わず、粗→細の潜在ピラミッドで3回のデノイジングのみ。それでもVBench-2.0でスコア66.77(10システム中1位)を達成し、多ステップシステムと同等品質を実現。1チャンク(1.5秒)の生成時間はH200 1枚で2.11秒です。 「持続的状態とデノイザーコンテキストのデカップリング」という発想の転換が、時間軸で破綻しない世界モデルへの道を開きました。 #世界モデル# #動画生成AI#
もっと見る
🕶️ 自分の体の動きで一人称の世界を歩き回り、しかも「特定の場所に何があるか」を画像とポーズで指定して時間変化まで作れる——身体性のある一人称世界モデルAnchorWorldです。 タイトル: AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization URL: 📝 概要 AnchorWorldは、人間の全身モーションで操作する一人称動画を生成する世界モデルです。さらに「アンカービュー」で、特定の3D位置に何が存在し、どう時間変化するかを明示的に指定できます。 ❓ 解決する課題 既存の世界モデルは、一人称動画だけでは全身モーションの教師付けが難しく、環境も暗黙的にしか定義できませんでした。「自然な身体操作」と「局所的な世界カスタマイズ」の両方が欠けていたのです。 💡 方法論と提案手法 ・一人称では体の多くが見えないため、三人称動画を補助教師に使い、全身と環境の位置関係を学習します ・アンカーはRGB画像・6-DoF視点ポーズ・進化プロンプトの3要素で、特定位置の見た目と時間変化を指定します ・3D RoPEで複数アンカーを空間的に区別し、masked cross-attentionでアンカーごとのテキスト制御を実現します ・三人称→一人称→静的アンカー→動的進化、の4段階で段階的に学習します(Wan 2.2 TI2V 5B上に構築) 🎯 ユースケース VRの身体性アプリ、一人称ゲームの環境設計、身体性AIの学習シナリオ、局所制御つきのインタラクティブ動画生成などに使えます。 📊 実験結果 ・一人称静的シーンでCLIP-V 0.885、カメラ精度ATE 0.112mとPlayerOneなどを上回りました ・一人称動的シーンのテキスト整合(VideoAlign-TA)は0.717で、CaM-Egoの0.385を大きく超えました ・分布外のUEシーンや実世界でも、初期ビューとアンカーの重なりが少ない条件で強い汎化を示しました #WorldModel# #EmbodiedAI#
もっと見る
浙江大学と清華大学の研究チームが、ロボット制御向けの世界モデル(行動を起こすと画像がどう変わるかを予測するモデル)に対して、探索なしで行動を決められる新しい学習法「INTACT」を提案した(https://arxiv[.]org/html/2607.26056v1)。 画像はその全体構成。従来はゴールに近づく行動をCEM(大量の行動候補をランダムに生成してシミュレートし、良さそうなものを選ぶ探索的な計画手法)で毎回探すのが定番で、1回のプランニングに平均1.48秒かかっていた。INTACTは同じオフラインの実演データから「今の状態から実際に起きた変化」と「今の状態からゴールまでの差分」の両方を、1つの共有した行動予測モジュールに同時学習させる。これにより探索を一切使わずにいきなり行動が出せるDirect制御が可能になり、レイテンシは2.9〜5.5ミリ秒まで縮んだ。 PushT/Cube/Reacher/TwoRoomの4タスクをそれぞれ個別に学習したモデルでも、Directだけで成功率85.78%/100.00%/97.67%/97.89%を達成。Direct案の周辺だけをCEMで軽く確認するごく小さな検証(候補384個、CEMの9,000個の23分の1)を足すと、4タスク平均96.86%、最も苦手なタスクでも92.22%まで伸びる。1つのエンコーダ(画像を圧縮した表現に変換する部分)で4タスクを同時に学習させても平均89.39%届き、土台となった従来の世界モデル「LeWM」に対しタスクによっては最大42.44ポイント差をつけた。 興味深いのは、同じ共有エンコーダの設定で行動を出す部分を完全に無効化し、旧来のCEM探索だけで評価しても、INTACTの目的関数で学習した表現のほうが成功率が66.17%から70.08%に伸びる点。行動予測ヘッドを追加しただけでなく、世界モデルの表現そのものを底上げしていることになる。
もっと見る
🌍 「自己教師あり学習はいつ世界の真の構造を復元できるのか?」——その答えが“潜在変数がガウス分布のときだけ”だと数学的に証明した、LeCunらの理論研究です。 タイトル: When Does LeJEPA Learn a World Model? URL: 💡 概要 LeJEPA(JEPA+ガウス正則化SIGReg+アライメント)が、非線形な観測から世界の潜在変数を「回転を除いて線形に」復元できる条件を理論的に解明しました。鍵は潜在がガウス分布でOU過程に従うことです。 ⚠️ 解決する課題 表現が世界の真の自由度を歪めると、信頼できる計画や構成的汎化ができません。自己教師あり学習がいつ世界構造を証明可能に復元するのかは未解明でした。 🛠 方法論と核心 ・最適表現は潜在過程の「最も遅い特徴」を固有値順に抽出する ・エルミート多項式とMehlerの公式により、ビュー間相関は非線形の次数dに対しρ^dで減衰 ・つまりアライメントはあらゆる非線形性を罰し、線形写像が唯一の最適解になる ・線形可識別性が成り立てば、潜在空間での計画は真の世界と同一の最適行動を返す(制御にそのまま使える) ・逆に「常に線形最適」を要求すると潜在分布はガウスでなければならない(唯一性) 📊 実験結果 ・SIGRegとVICRegは1024次元までR²>0.999で線形復元 ・一般化正規分布の掃引でR²はα=2(ガウス)で鋭くピーク ・ピクセルからのロボット制御ではガウスOUでR²=0.95、非ガウスな実軌跡はR²≤0.5 ・制御コストはR²と単調に連動し、ガウス符号化器はオラクル級 #世界モデル# #自己教師あり学習#
もっと見る