🌍 TL;DR: 撮影済みの動画を、追加学習なしで別の視点から「再体験」できる世界モデル制御手法が登場しました。凍結モデルのアテンション機構だけで視点変更・穴埋め・過去の見た目再現をすべてこなします。
タイトル: World in World: Explore the World with World Models
URL:
ポイント
🎥 元動画・目標視点・レンダリング幾何・生成履歴という4種類の視覚エビデンスをクリーンなK/Vに変換して凍結モデルに供給
🧭 CGAR(対応関係ガイド付きアテンションルーティング)が信頼できる元動画トークンへクエリを誘導
🎚 EWA(エビデンス単位のアテンションCFG)が各補助情報の寄与を追加計算なしで個別調整
🏆 VBench総合スコア85.192、回転誤差2.8326°でReCamMasterなど6手法中トップ
🔧 視点変更以外にバレットタイム表現・手ブレ補正・動画編集・モーション転写まで同じ枠組みで対応
追加学習なしでここまで多機能なのは、エビデンス設計の勝利という印象です。
#
世界モデル# #
動画生成#