가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
가입 May 2026
270 팔로잉 중    316
動画生成モデルは「正しい映像を作れる」のか、それとも「もっともらしく見える映像を作れる」だけなのか。 これは似ているようで本質的に異なる問いです。物体を正しく配置し物理法則を守りながら複数ステップのタスクを解くこと——これを「視覚的知性(Visual Grounded Intelligence)」と呼ぶならば、現在のモデルはそれを持っているでしょうか。VGI-Benchはその問いに数字で答えます。 27タスク810インスタンスのベンチマークで9つの動画モデルを評価した結果、最強モデルのSeedance 2.0でも全体スコアは51.0%にとどまりました。物理崩壊(非現実的な変形・物体の貫通)、ルール違反(もっともらしい最終状態を出しながら制約を無視)、物体不整合(時間をまたいだ一貫性の喪失)という3つの失敗モードが繰り返し現れます。オープンソース最高のHunyuanVideoは19.1%と商用モデルを大きく下回りました。 より深刻なのは、デノイジング過程の分析が明らかにしたことです。生成中間ステップでの自己修正は全体の1%未満。「誤り→別の誤り」への遷移がデノイジング中盤で23.1%に達しており、後期デノイジングは初期に固定された仮説を磨くだけで誤りを直せていません。さらに、1M合成サンプルによるファインチューニングは計画・空間スキルを改善する一方で時間的・物理的能力を劣化させるというトレードオフも確認されました。VGI-Benchは視覚推論という軸で動画生成の限界を照らし出しています。 タイトル: VGI-Bench: Probing Visual Intelligence in Video Generation Models URL: #動画生成# #視覚推論#
더 보기