登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 WorldModels
WorldModels コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
WorldModels を含む検索結果
ゲームの世界モデルはピクセルを直接生成しがちですが、長く回すほど姿勢や幾何がズレていきます。Marionetteは「正確さが要る部分」を潔く手放しました。 タイトル: Marionette: Predicting World States, Rendering Geometry, Painting Appearance URL: 幾何・遮蔽・運動は決定的レンダラーに委ね、ニューラルには見た目だけを描かせる世界モデルです。注目ポイントは3つ。 🎮 注目ポイント1: 明示的な276次元の世界状態を予測 ピクセルではなく、関節・ルート軌跡・回転からなる3D状態を2段階の自己回帰で予測します。制御は行動トークンを上書きするだけ(プレイヤーのボタン押下と同じ)。誤った行動を強制するとポーズが約31%ズレる=制御が確かに効いている証拠です。 📐 注目ポイント2: ゼロパラメータの決定的レンダラー 6つの閉形式演算だけで状態をポーズ制御動画へ変換。ワールド整合性・遮蔽順序・計量スケールが「構成上」保証されます。長期の破綻は、外見モデルを再訓練せず地形コライダーなどのルールで修復でき、貫通を66%削減しました。 🎨 注目ポイント3: 見た目だけを担う動画拡散 Wan2.2-Fun-5Bベースの拡散が、正確な幾何の上に写実的なRGBを合成。予測状態経由でもFVDは831(記録状態799、ピクセル自己回帰は975)で、忠実度の低下は検出されませんでした。 正確さは決定的計算に、見た目はニューラルに。世界モデルの分業の good design です。 #WorldModels# #GameAI#
もっと見る
動画生成AIが物を壁の後ろに隠すと、なぜか別の物になって出てくる。この「物体永続性」の欠陥に真正面から挑んだ研究です。 タイトル: Training Object Permanence in World Models URL: 📝 概要 人間の乳児が生後半年で獲得する「物体永続性」と「物体の固体性」を、動画生成モデルに学習させる取り組みです。150種の合成タスクから150万件の学習データと評価ベンチマークWROPを作り、160億パラメータのモデルPWM-WROPを構築しました。 ❓ 解決する課題 Sora等の動画生成モデルは、物体が遮蔽物の後ろで消えたまま別物として再出現したり、固体の壁を平気で貫通したりします。この欠陥が衝突や因果関係の推論全体を損なっていました。 💡 方法論と提案手法 Blenderで生成した150種のタスクを「遮蔽」「固体性」の6ファミリーに整理し、物体数や軌道などの構造パラメータは体系的に変え、色や照明などの表面パラメータはランダム化することで記憶による解答を防ぎます。これをCosmos3-Nanoにファインチューニングしました。 📊 実験結果 人間による361件のペア比較評価で、PWM-WROPは真の継続生成モデルの中で1位(Elo 1679.5)、次点に224ポイント差をつけました。静的遮蔽タスクでは全モデル中1位を獲得した一方、衝突などの固体性タスクでは苦戦が見られました。 🌍 ユースケース 学習データ・モデル重み・AWS Trainium2向けの学習基盤PWMを公開し、物理的に妥当な世界モデル構築の土台を提供します。 #世界モデル# #動画生成AI#
もっと見る
🎮 コードエージェントが強いのは「実行して検証できる」から。同じ発想をゲーム開発に持ち込み、世界モデルの学習を加速させる研究です。 タイトル: Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models URL: 🧩 概要 動画やCLIPスコアのような曖昧なプロキシ指標では報酬がゲーム化されやすいという「検証可能性のボトルネック」を指摘し、ゲームエンジンの衝突判定・物理演算・navmeshチェックを報酬源として活用する手法を提案しています。 ❗ 解決する課題 空間生成モデル(動画・3D・世界モデル)は信頼できる報酬信号を欠いており、スケーリングしても真の能力向上につながらない「不可検証性の代償」を抱えています。 🛠 方法論と提案手法 エンジン由来の密な構造的報酬と人間の採否判断を組み合わせるRLHEV、Propose→Render→Verify→Repair→Reviewの反復ループを回すAWoMoエージェント、開発トレースを統一構造化するUWDPプロトコルを提案しています。 📊 実験結果 UnitySceneBenchで曖昧プロキシ比+0.098、クロスエンジン汎化はUnity→Godotで0.15→0.35に向上。さらにD4RL Gym-MuJoCoで+48.43%、R2Rナビゲーションで+0.79%の性能向上も確認されています。 #世界モデル# #強化学習#
もっと見る
🌍 TL;DR: 撮影済みの動画を、追加学習なしで別の視点から「再体験」できる世界モデル制御手法が登場しました。凍結モデルのアテンション機構だけで視点変更・穴埋め・過去の見た目再現をすべてこなします。 タイトル: World in World: Explore the World with World Models URL: ポイント 🎥 元動画・目標視点・レンダリング幾何・生成履歴という4種類の視覚エビデンスをクリーンなK/Vに変換して凍結モデルに供給 🧭 CGAR(対応関係ガイド付きアテンションルーティング)が信頼できる元動画トークンへクエリを誘導 🎚 EWA(エビデンス単位のアテンションCFG)が各補助情報の寄与を追加計算なしで個別調整 🏆 VBench総合スコア85.192、回転誤差2.8326°でReCamMasterなど6手法中トップ 🔧 視点変更以外にバレットタイム表現・手ブレ補正・動画編集・モーション転写まで同じ枠組みで対応 追加学習なしでここまで多機能なのは、エビデンス設計の勝利という印象です。 #世界モデル# #動画生成#
もっと見る
ワールドモデルの評価、本当にできていますか?スコアだけ出して中身はブラックボックス——そんな評価手法に終止符を打つ研究が登場しました。 HarnessEval-W: Agentifying the Evaluation of Visual Worlds ❓ そもそも何が問題だったの? 💡 既存のワールドモデルベンチマークはスカラー値しか返さず、なぜそのスコアになったかの推論根拠を示せませんでした。また物理的妥当性・因果関係・状態の持続性を「人間がやるように」自動検証する手段がなかったのです。 ❓ どんな仕組みで評価するの? 💡 3層のエージェント階層で動きます。まずケースを専門スキルへルーティングし、サブエージェントが個々の問いに答え、親エージェントがエビデンスを集約してスコアを出します。全工程の推論が証拠ツリーとして記録されるため、どの判断も追跡・監査できます。評価軸は観測品質・遷移の正確さ・世界の持続性の3カテゴリ8設定、330件のケースで18モデルを評価しました。 ❓ 従来手法と比べてどう違う? 💡 物理遷移のペアワイズ精度が WBench の 31.9% から 71.7% へ、引き分け率は 52.2% から 1.8% にまで激減しました。人間の判断との一致も高く、意図的遷移で Spearman ρ=0.93、物理遷移で ρ=0.87 を達成(5,000件のペアワイズA/B判定で検証)。 ❓ 実際のモデル評価で何かわかった? 💡 上位は Seedance 2.0(75.5)、Wan 2.7(75.0)、Kling 3.0(74.4)の順。そしてファインチューニング分析が示す「能力トレードオフ」が興味深く、DreamX-World は探索的遷移で +4.8 改善しながら意図的遷移が −11.9 悪化。画質の良さと物理挙動の正確さも r=−0.04 でほぼ独立した能力であることがわかりました。 #WorldModel# #ビデオ生成#
もっと見る
「物理世界モデル」の新アプローチ——ピクセルを予測する前に「世界がどう変化するか」を言語として推論します。 タイトル: PhiZero: A World Model Built Around Physical Language ❓ 「物理言語(Physical Language)」とは何ですか? 💡 動画の状態遷移パターンを離散的なトークン列として直接表現する新しい中間表現です。外観(見た目)と動力学(動き方)を分離して学習するため、ソース動画の状態遷移を全く別の視覚スタイルに転送できます。PhiZeroはこの「物理言語」を推論してから動画を生成する「Reason-then-render」パラダイムを実現します。 ❓ 従来の物理世界モデルはなぜ物理的に不自然だったのですか? 💡 ピクセル空間での直接予測に頼っていたため、動力学がモデル内部に暗黙的に埋め込まれ、見た目のリアルさと物理的整合性の両立が困難でした。テニスボールがゴムアヒルに当たってもアヒルが反応しないような物理的矛盾が生じやすく、推論過程も不透明でした。 ❓ 具体的にどんな性能を達成しましたか? 💡 6つのベンチマーク全てで最高水準の結果を出しました。 ・Physics-IQ IQ-Score:41.2(前SOTA 39.5を更新) ・WorldModelBench 物理準拠・常識・総合で全て最高スコア ・因果関係理解YoCausal:集約ランク2.0(最高) ・トークナイザーはわずか256トークンでPSNR 28.9の高品質再構成を実現(Wan2.2-5B VAEの175分の1) ❓ ロボティクスや自動運転への応用はどうなりますか? 💡 物理言語は外観に依存しない遷移表現なので、シミュレーション→実世界(Sim-to-real)や人間→ロボットへのゼロショット転送が実現します。LIBERO シミュレーション動画の物理言語を保存し、リアルな映像で再生したり、人間の動作パターンをロボットに直接適用する実験が成功しています。 #WorldModel# #EmbodiedAI#
もっと見る
🕶️ 自分の体の動きで一人称の世界を歩き回り、しかも「特定の場所に何があるか」を画像とポーズで指定して時間変化まで作れる——身体性のある一人称世界モデルAnchorWorldです。 タイトル: AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization URL: 📝 概要 AnchorWorldは、人間の全身モーションで操作する一人称動画を生成する世界モデルです。さらに「アンカービュー」で、特定の3D位置に何が存在し、どう時間変化するかを明示的に指定できます。 ❓ 解決する課題 既存の世界モデルは、一人称動画だけでは全身モーションの教師付けが難しく、環境も暗黙的にしか定義できませんでした。「自然な身体操作」と「局所的な世界カスタマイズ」の両方が欠けていたのです。 💡 方法論と提案手法 ・一人称では体の多くが見えないため、三人称動画を補助教師に使い、全身と環境の位置関係を学習します ・アンカーはRGB画像・6-DoF視点ポーズ・進化プロンプトの3要素で、特定位置の見た目と時間変化を指定します ・3D RoPEで複数アンカーを空間的に区別し、masked cross-attentionでアンカーごとのテキスト制御を実現します ・三人称→一人称→静的アンカー→動的進化、の4段階で段階的に学習します(Wan 2.2 TI2V 5B上に構築) 🎯 ユースケース VRの身体性アプリ、一人称ゲームの環境設計、身体性AIの学習シナリオ、局所制御つきのインタラクティブ動画生成などに使えます。 📊 実験結果 ・一人称静的シーンでCLIP-V 0.885、カメラ精度ATE 0.112mとPlayerOneなどを上回りました ・一人称動的シーンのテキスト整合(VideoAlign-TA)は0.717で、CaM-Egoの0.385を大きく超えました ・分布外のUEシーンや実世界でも、初期ビューとアンカーの重なりが少ない条件で強い汎化を示しました #WorldModel# #EmbodiedAI#
もっと見る