🎬 「見た目はリアルでも、タスクを達成できているか?」——ビデオ生成の評価がついに結果志向へ進化します。
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
💡 概要
参照画像から「料理を作る」「植物を剪定する」などのタスクを達成するビデオを生成する際、既存モデルは手順の再現には長けていますが「最終状態をきちんと達成できているか」の評価が欠けていました。SemComp-Bench は6ドメイン・1,273件のデータセットと、VLM(Doubao-Seed-1.8)を用いた二軸評価フレームワークを導入し、この盲点を埋めます。
⚠️ 解決する課題
既存ベンチマークは外観の一致性や中間手順を重視し、「タスクの結果達成」と「参照画像との意味論的整合性の維持」を同時に評価する基準がありませんでした。
🔬 評価フレームワーク:2つの独立した次元
・OA(Outcome Achievement)スコア: 結果実現・意味論的グラウンディング・エンティティ一貫性・視覚的連続性の4基準をすべて通過することが必要
・GR(Generation Reliability)スコア: 物理的整合性・視覚明瞭度・アーティファクト欠如など5基準の平均
📊 実験結果(詳細指示での成績)
・OA最高: HunyuanVideo-1.5-720P が37.8%(最高でも4割未満)
・GR最高: Seedance 2.0 が91.8%——だがOAは20.0%(4位)
・T2V(テキストのみ)のOAはわずか0.6〜5.0%: 視覚的参照が不可欠
・最大のボトルネック: Within-Scene Spatiotemporal Coherence(0.328〜0.739)
→ OAとGRは独立した能力であり、「綺麗に生成できる」ことと「タスクを達成できる」ことは別問題です。
#
動画生成# #
ベンチマーク#