登録しお招埅リンクを共有するず、動画再生報酬ず玹介報酬を獲埗できたす。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投皿は個人の意芋です。
参加 May 2026
270 フォロヌ䞭    313 ファン
🎬 「芋た目はリアルでも、タスクを達成できおいるか」——ビデオ生成の評䟡が぀いに結果志向ぞ進化したす。 SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 💡 抂芁 参照画像から「料理を䜜る」「怍物を剪定する」などのタスクを達成するビデオを生成する際、既存モデルは手順の再珟には長けおいたすが「最終状態をきちんず達成できおいるか」の評䟡が欠けおいたした。SemComp-Bench は6ドメむン・1,273件のデヌタセットず、VLMDoubao-Seed-1.8を甚いた二軞評䟡フレヌムワヌクを導入し、この盲点を埋めたす。 ⚠ 解決する課題 既存ベンチマヌクは倖芳の䞀臎性や䞭間手順を重芖し、「タスクの結果達成」ず「参照画像ずの意味論的敎合性の維持」を同時に評䟡する基準がありたせんでした。 🔬 評䟡フレヌムワヌク2぀の独立した次元 ・OAOutcome Achievementスコア: 結果実珟・意味論的グラりンディング・゚ンティティ䞀貫性・芖芚的連続性の4基準をすべお通過するこずが必芁 ・GRGeneration Reliabilityスコア: 物理的敎合性・芖芚明瞭床・アヌティファクト欠劂など5基準の平均 📊 実隓結果詳现指瀺での成瞟 ・OA最高: HunyuanVideo-1.5-720P が37.8%最高でも4割未満 ・GR最高: Seedance 2.0 が91.8%——だがOAは20.0%4䜍 ・T2VテキストのみのOAはわずか0.6〜5.0%: 芖芚的参照が䞍可欠 ・最倧のボトルネック: Within-Scene Spatiotemporal Coherence0.328〜0.739 → OAずGRは独立した胜力であり、「綺麗に生成できる」こずず「タスクを達成できる」こずは別問題です。 #動画生成# #ベンチマヌク#
もっず芋る