1時間以上のインタラクティブ世界を、単一GPUで生成し続けられる——そんな世界モデルが登場しました。
Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
動画世界モデルの核心技術を3つに絞り込み、徹底的に深掘りします。
🗺 注目ポイント1:外部幾何学メモリによるO(1)コンテキスト
従来の世界モデルは生成が長くなるほどトランスフォーマーの文脈長が爆発し、実質的に数分が限界でした。EVOKEは生成フレームから単眼深度推定を行い、カメラポーズでインデックスした「ワールドステートバンク」に3D点群として外部保存します。次チャンク生成時はバンクから必要な幾何学情報を検索してデノイザーに注入するため、セッションが65分を超えても各コールの入力サイズは1.5秒(9フレーム)のまま一定です。「セッション長は再帰コールの回数のみを増やし、各コールのコンテキスト長は一切増やさない」という設計が鍵です。
🎓 注目ポイント2:監督ホライゾンと勾配ホライゾンの分離
長期的な一貫性には長いホライゾンで監督する必要がありますが、バックプロパゲーションのメモリが問題でした。EVOKEは14B Wan2.2教師モデルを設計し、「教師は完全軌跡を評価するが、学生の勾配計算はチャンクごとに切り離す」という手法で解決します。制御実験では、長ホライゾン教師(30秒監督)の学生は輝度が101%で安定、短ホライゾン教師の学生は74%に下落(Wilcoxon p=0.016)。長い教師監督が長期一貫性の「要」であることが統計的に証明されました。
⚡ 注目ポイント3:CFGなし3ステップ推論でVBench-2.0首位
CFG(Classifier-Free Guidance)を一切使わず、粗→細の潜在ピラミッドで3回のデノイジングのみ。それでもVBench-2.0でスコア66.77(10システム中1位)を達成し、多ステップシステムと同等品質を実現。1チャンク(1.5秒)の生成時間はH200 1枚で2.11秒です。
「持続的状態とデノイザーコンテキストのデカップリング」という発想の転換が、時間軸で破綻しない世界モデルへの道を開きました。
#
世界モデル# #
動画生成AI#