登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 WorldModel
WorldModel コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
WorldModel を含む検索結果
ゲームの世界モデルはピクセルを直接生成しがちですが、長く回すほど姿勢や幾何がズレていきます。Marionetteは「正確さが要る部分」を潔く手放しました。 タイトル: Marionette: Predicting World States, Rendering Geometry, Painting Appearance URL: 幾何・遮蔽・運動は決定的レンダラーに委ね、ニューラルには見た目だけを描かせる世界モデルです。注目ポイントは3つ。 🎮 注目ポイント1: 明示的な276次元の世界状態を予測 ピクセルではなく、関節・ルート軌跡・回転からなる3D状態を2段階の自己回帰で予測します。制御は行動トークンを上書きするだけ(プレイヤーのボタン押下と同じ)。誤った行動を強制するとポーズが約31%ズレる=制御が確かに効いている証拠です。 📐 注目ポイント2: ゼロパラメータの決定的レンダラー 6つの閉形式演算だけで状態をポーズ制御動画へ変換。ワールド整合性・遮蔽順序・計量スケールが「構成上」保証されます。長期の破綻は、外見モデルを再訓練せず地形コライダーなどのルールで修復でき、貫通を66%削減しました。 🎨 注目ポイント3: 見た目だけを担う動画拡散 Wan2.2-Fun-5Bベースの拡散が、正確な幾何の上に写実的なRGBを合成。予測状態経由でもFVDは831(記録状態799、ピクセル自己回帰は975)で、忠実度の低下は検出されませんでした。 正確さは決定的計算に、見た目はニューラルに。世界モデルの分業の good design です。 #WorldModels# #GameAI#
もっと見る
ワールドモデルの評価、本当にできていますか?スコアだけ出して中身はブラックボックス——そんな評価手法に終止符を打つ研究が登場しました。 HarnessEval-W: Agentifying the Evaluation of Visual Worlds ❓ そもそも何が問題だったの? 💡 既存のワールドモデルベンチマークはスカラー値しか返さず、なぜそのスコアになったかの推論根拠を示せませんでした。また物理的妥当性・因果関係・状態の持続性を「人間がやるように」自動検証する手段がなかったのです。 ❓ どんな仕組みで評価するの? 💡 3層のエージェント階層で動きます。まずケースを専門スキルへルーティングし、サブエージェントが個々の問いに答え、親エージェントがエビデンスを集約してスコアを出します。全工程の推論が証拠ツリーとして記録されるため、どの判断も追跡・監査できます。評価軸は観測品質・遷移の正確さ・世界の持続性の3カテゴリ8設定、330件のケースで18モデルを評価しました。 ❓ 従来手法と比べてどう違う? 💡 物理遷移のペアワイズ精度が WBench の 31.9% から 71.7% へ、引き分け率は 52.2% から 1.8% にまで激減しました。人間の判断との一致も高く、意図的遷移で Spearman ρ=0.93、物理遷移で ρ=0.87 を達成(5,000件のペアワイズA/B判定で検証)。 ❓ 実際のモデル評価で何かわかった? 💡 上位は Seedance 2.0(75.5)、Wan 2.7(75.0)、Kling 3.0(74.4)の順。そしてファインチューニング分析が示す「能力トレードオフ」が興味深く、DreamX-World は探索的遷移で +4.8 改善しながら意図的遷移が −11.9 悪化。画質の良さと物理挙動の正確さも r=−0.04 でほぼ独立した能力であることがわかりました。 #WorldModel# #ビデオ生成#
もっと見る
「物理世界モデル」の新アプローチ——ピクセルを予測する前に「世界がどう変化するか」を言語として推論します。 タイトル: PhiZero: A World Model Built Around Physical Language ❓ 「物理言語(Physical Language)」とは何ですか? 💡 動画の状態遷移パターンを離散的なトークン列として直接表現する新しい中間表現です。外観(見た目)と動力学(動き方)を分離して学習するため、ソース動画の状態遷移を全く別の視覚スタイルに転送できます。PhiZeroはこの「物理言語」を推論してから動画を生成する「Reason-then-render」パラダイムを実現します。 ❓ 従来の物理世界モデルはなぜ物理的に不自然だったのですか? 💡 ピクセル空間での直接予測に頼っていたため、動力学がモデル内部に暗黙的に埋め込まれ、見た目のリアルさと物理的整合性の両立が困難でした。テニスボールがゴムアヒルに当たってもアヒルが反応しないような物理的矛盾が生じやすく、推論過程も不透明でした。 ❓ 具体的にどんな性能を達成しましたか? 💡 6つのベンチマーク全てで最高水準の結果を出しました。 ・Physics-IQ IQ-Score:41.2(前SOTA 39.5を更新) ・WorldModelBench 物理準拠・常識・総合で全て最高スコア ・因果関係理解YoCausal:集約ランク2.0(最高) ・トークナイザーはわずか256トークンでPSNR 28.9の高品質再構成を実現(Wan2.2-5B VAEの175分の1) ❓ ロボティクスや自動運転への応用はどうなりますか? 💡 物理言語は外観に依存しない遷移表現なので、シミュレーション→実世界(Sim-to-real)や人間→ロボットへのゼロショット転送が実現します。LIBERO シミュレーション動画の物理言語を保存し、リアルな映像で再生したり、人間の動作パターンをロボットに直接適用する実験が成功しています。 #WorldModel# #EmbodiedAI#
もっと見る
🕶️ 自分の体の動きで一人称の世界を歩き回り、しかも「特定の場所に何があるか」を画像とポーズで指定して時間変化まで作れる——身体性のある一人称世界モデルAnchorWorldです。 タイトル: AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization URL: 📝 概要 AnchorWorldは、人間の全身モーションで操作する一人称動画を生成する世界モデルです。さらに「アンカービュー」で、特定の3D位置に何が存在し、どう時間変化するかを明示的に指定できます。 ❓ 解決する課題 既存の世界モデルは、一人称動画だけでは全身モーションの教師付けが難しく、環境も暗黙的にしか定義できませんでした。「自然な身体操作」と「局所的な世界カスタマイズ」の両方が欠けていたのです。 💡 方法論と提案手法 ・一人称では体の多くが見えないため、三人称動画を補助教師に使い、全身と環境の位置関係を学習します ・アンカーはRGB画像・6-DoF視点ポーズ・進化プロンプトの3要素で、特定位置の見た目と時間変化を指定します ・3D RoPEで複数アンカーを空間的に区別し、masked cross-attentionでアンカーごとのテキスト制御を実現します ・三人称→一人称→静的アンカー→動的進化、の4段階で段階的に学習します(Wan 2.2 TI2V 5B上に構築) 🎯 ユースケース VRの身体性アプリ、一人称ゲームの環境設計、身体性AIの学習シナリオ、局所制御つきのインタラクティブ動画生成などに使えます。 📊 実験結果 ・一人称静的シーンでCLIP-V 0.885、カメラ精度ATE 0.112mとPlayerOneなどを上回りました ・一人称動的シーンのテキスト整合(VideoAlign-TA)は0.717で、CaM-Egoの0.385を大きく超えました ・分布外のUEシーンや実世界でも、初期ビューとアンカーの重なりが少ない条件で強い汎化を示しました #WorldModel# #EmbodiedAI#
もっと見る
World modelで興味深いのは、研究デモから実インフラへ移り始めた点です。Googleは2026年1月、Genie 3を「Project Genie」として一般提供を開始しました。さらにWaymoはGenie 3を改造した独自World modelで、自動運転のレアケースを生成し学習に使っています。世界を「作る」AIが、現実の訓練を支え始めています。
もっと見る
「World model」という言葉、今いろんな意味で使われすぎてて要注意。 ざっくり整理すると ・Genie3みたいに生成して遊べる3D世界 ・V-JEPAみたいに抽象表現で予測する潜在モデル ・自動運転の物理シミュレータ ・ゲームから学ぶモデル 同じ単語でも、指してる中身は全然違う。
もっと見る
World modelの賭けはシンプルだ。テキストの次の単語を当てるLLMでは、物理を理解する知能には届かない、というもの。LeCunはこの主張でメタを辞め、約1500億円を集めた。ピクセルじゃなく抽象表現で世界の動きを予測する。言葉の外に知能はあるか、が論点だ。
もっと見る
World modelがLLMを置き換える、と盛り上がってるけど、少し冷静になった方がいい。巨額の資金は動いてるが、実用的な製品はまだ数年先という見方が普通。提唱側のCEO自身が「半年で各社がworld modelを名乗り出す」と言ってるくらいだ。バズワード化には用心したい。
もっと見る
预言下一波牛市叙事:DePIN + World Model
ロボット操作のビデオ世界モデルで「本当に指定した動作をしているか」を検証できるモデルが登場しました。 DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation Wan2.2-TI2V-5Bを基盤に、初期フレームと言語指示、両腕の行動軌道から将来フレームを高精度に予測するビデオ世界モデルです。WorldArena 2.0 Track 1で31チーム中1位(EWMScore-P: 60.65)を達成しました。 🔷 注目ポイント1: PRoPE — SE(3)を直接アテンションへ注入 行動を汎用トークンに変換する従来手法を捨て、エンドエフェクタの位置・回転行列・グリッパー状態をSE(3)変換としてアテンション機構に直接組み込みます。アームごとにヘッドをパーティションし、Kronecker積でトークンワイズ変換を適用することで、グローバル座標系への依存を排除。制御性スコア98.55という驚異的な数値を叩き出しています。 🔶 注目ポイント2: 深度ブランチ + 物体中心監督で「見た目」以上の精度を RGB損失だけでは表面順序やオブジェクト範囲を制約できないという根本問題に、2段構えで対処します。軽量な深度ブランチ(最後のMブロックを複製した一方向クロスアテンション)が幾何学的整合性を担保し、SAM3マスクと凍結V-JEPAティーチャーのグラム行列制約が操作物体の時間的一貫性を保ちます。静的背景が大きなロボット映像において、接触近傍のエラーを損失関数に確実に反映させる仕組みです。 🟣 注目ポイント3: DMD蒸留で多ステップを少ステップへ KL divergenceと非飽和GAN損失を組み合わせた分布マッチング蒸留(DMD)により、推論時のステップ数を大幅に削減。Ego4D・AgiBot World 2026・RoboTwin 2.0など合計約6,000時間超の多様なデータで学習されており、広範な視覚事前知識と行動接地の両立を実現します。 ロボット世界モデルがついに「リアルに見える」から「正確に動く」へ進化した一歩です。 #ロボティクス# #世界モデル#
もっと見る