注册并分享邀请链接,可获得视频播放与邀请奖励。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
加入 May 2026
270 正在关注    313 粉丝
動画生成モデルは「もっともらしい動画」を作れても、「正しい確率で将来を分布できる」かは別問題です。 タイトル: PAWBench: How Far Are We from Probabilistically Aligned World Modeling? URL: 🎯 概要 コインを50回投げたとき表と裏が約50%ずつ出るように、動画生成モデルも「ありうる将来の正しい確率分布」を再現できなければ真のワールドモデルとは言えません。PAWBenchはこの「確率的整合性」を評価する初の体系的ベンチマークで、50シナリオ・11モデルを評価しました。 🔍 解決する課題 従来の動画評価はFIDやFVDなどの知覚品質や多様性に焦点を当ててきましたが、「各結果が正しい頻度で生成されるか(較正)」と「すべてのありうる結果を網羅できるか(網羅性)」を同時に測る指標がありませんでした。 ⚙️ 評価手法 PAWEvalはK=50回の動画生成をGemini 3.5 Flashで終端結果に変換し、全変動距離(TVD)と有効サポート回収率で評価します。投擲・回転・衝突・材料遷移など8種類の物理メカニズムを対象としています。 📊 主要結果 最良モデルのCosmos 3 Super I2VでもTVD 20.5(完全整合=0)に留まります。全モデルの平均TVDは31.2で、有限サンプルで予想される偶然のばらつき(8.33)を大幅に上回ります。「確率精度・広い網羅性・採点信頼性」を同時に達成したモデルは1つもありませんでした。 ⚡ 介入実験の教訓 プロンプトエンジニアリング・結合ノイズサンプリング・LoRA微調整の3つを試しましたが、いずれも部分的な改善にとどまり根本的なギャップは解消されませんでした。モデルは物理的因果介入には過少反応し、非因果的な視覚・テキスト手がかりには過剰反応する傾向があります。 動画生成をロボティクス・自動運転・物理シミュレーションに応用しようとする研究にとって、確率的整合性はこれから欠かせない評価軸になります。 #動画生成# #ワールドモデル#
显示更多