「物理世界モデル」の新アプローチ——ピクセルを予測する前に「世界がどう変化するか」を言語として推論します。
タイトル: PhiZero: A World Model Built Around Physical Language
❓ 「物理言語(Physical Language)」とは何ですか?
💡 動画の状態遷移パターンを離散的なトークン列として直接表現する新しい中間表現です。外観(見た目)と動力学(動き方)を分離して学習するため、ソース動画の状態遷移を全く別の視覚スタイルに転送できます。PhiZeroはこの「物理言語」を推論してから動画を生成する「Reason-then-render」パラダイムを実現します。
❓ 従来の物理世界モデルはなぜ物理的に不自然だったのですか?
💡 ピクセル空間での直接予測に頼っていたため、動力学がモデル内部に暗黙的に埋め込まれ、見た目のリアルさと物理的整合性の両立が困難でした。テニスボールがゴムアヒルに当たってもアヒルが反応しないような物理的矛盾が生じやすく、推論過程も不透明でした。
❓ 具体的にどんな性能を達成しましたか?
💡 6つのベンチマーク全てで最高水準の結果を出しました。
・Physics-IQ IQ-Score:41.2(前SOTA 39.5を更新)
・WorldModelBench 物理準拠・常識・総合で全て最高スコア
・因果関係理解YoCausal:集約ランク2.0(最高)
・トークナイザーはわずか256トークンでPSNR 28.9の高品質再構成を実現(Wan2.2-5B VAEの175分の1)
❓ ロボティクスや自動運転への応用はどうなりますか?
💡 物理言語は外観に依存しない遷移表現なので、シミュレーション→実世界(Sim-to-real)や人間→ロボットへのゼロショット転送が実現します。LIBERO シミュレーション動画の物理言語を保存し、リアルな映像で再生したり、人間の動作パターンをロボットに直接適用する実験が成功しています。
#
WorldModel# #
EmbodiedAI#