登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 VideoGeneration
VideoGeneration コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
VideoGeneration を含む検索結果
🎬 蒸留された自己回帰の動画モデルは速い一方で、人間の好みからズレがちです。再蒸留も逆プロセスの展開も使わず、「順プロセス」で強化学習アラインメントを行うAstrolabeが、その難題に答えます。 タイトル: Astrolabe: Steering Forward-Process Reinforcement Learning URL: 📝 概要 Astrolabeは、蒸留された自己回帰(AR)動画モデルを人間の視覚的な好みに整合させる強化学習フレームワークです。最大の特徴は、従来の逆プロセス最適化ではなく、順プロセス(forward-process)でRLを行う点にあります。全53ページ・37図の大規模な研究です。 ❓ 解決する課題 蒸留AR動画モデルは効率的なストリーミング生成に向く一方、人間の好みと乖離しやすいという弱点があります。さらに既存のRLは、こうしたアーキテクチャに自然には合いません。一般に、高コストな再蒸留か、ソルバー結合の逆プロセス最適化のいずれかを必要とし、どちらも重くスケールしにくいものでした。 💡 方法論と提案手法 3つの工夫から成ります。 ・負例認識の微調整:推論の終端で正例と負例を対比させ、逆プロセスを展開せずに、暗黙的なポリシー改善の方向を確立します ・ストリーミング学習:ローリングKVキャッシュでシーケンスを段階的に生成し、RL更新は局所的なクリップウィンドウにのみ適用、長距離の一貫性は先行コンテキストへの条件付けで維持します ・複数報酬の目的関数:不確実性を考慮した選択的正則化と動的な参照更新を統合し、報酬ハッキング(見かけのスコアだけ上げる崩壊)を緩和します 🎯 ユースケース リアルタイム・ストリーミングな動画生成で、効率的な蒸留モデルを速さを保ったまま好みへ整合させたい場面に向きます。複数の蒸留AR動画モデルに適用でき、推論の軽さを犠牲にせずに品質を底上げできます。 📊 意義と結果 ・再蒸留や逆プロセス展開という重い経路を避けることで、計算効率のボトルネックに対処します ・順プロセスでの負例認識・ストリーミング更新・報酬ハッキング対策を組み合わせ、堅牢でスケーラブルなアラインメント解を提供します ・複数の蒸留ARモデルにわたって有効性が示され、詳細な定量評価とアブレーションを含みます #VideoGeneration# #ReinforcementLearning#
もっと見る
🎬 「見た目はリアルでも、タスクを達成できているか?」——ビデオ生成の評価がついに結果志向へ進化します。 SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 💡 概要 参照画像から「料理を作る」「植物を剪定する」などのタスクを達成するビデオを生成する際、既存モデルは手順の再現には長けていますが「最終状態をきちんと達成できているか」の評価が欠けていました。SemComp-Bench は6ドメイン・1,273件のデータセットと、VLM(Doubao-Seed-1.8)を用いた二軸評価フレームワークを導入し、この盲点を埋めます。 ⚠️ 解決する課題 既存ベンチマークは外観の一致性や中間手順を重視し、「タスクの結果達成」と「参照画像との意味論的整合性の維持」を同時に評価する基準がありませんでした。 🔬 評価フレームワーク:2つの独立した次元 ・OA(Outcome Achievement)スコア: 結果実現・意味論的グラウンディング・エンティティ一貫性・視覚的連続性の4基準をすべて通過することが必要 ・GR(Generation Reliability)スコア: 物理的整合性・視覚明瞭度・アーティファクト欠如など5基準の平均 📊 実験結果(詳細指示での成績) ・OA最高: HunyuanVideo-1.5-720P が37.8%(最高でも4割未満) ・GR最高: Seedance 2.0 が91.8%——だがOAは20.0%(4位) ・T2V(テキストのみ)のOAはわずか0.6〜5.0%: 視覚的参照が不可欠 ・最大のボトルネック: Within-Scene Spatiotemporal Coherence(0.328〜0.739) → OAとGRは独立した能力であり、「綺麗に生成できる」ことと「タスクを達成できる」ことは別問題です。 #動画生成# #ベンチマーク#
もっと見る
🎬 参照画像の被写体を保ったまま、実写⇔ファンタジーのドメインをまたいで動画化できる被写体駆動T2Vです。 タイトル: DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation URL: 被写体の「忠実度」と「スタイル適応の柔軟性」を両立させたDomainShuttle。注目したい3点を紹介します。 🧬 Domain-MoT 動画と参照画像を独立2ブランチで処理し、参照側は時間に加えてドメイン属性(実在人物/物体/背景/ファンタジー)で変調するDomain-aware AdaLNを採用。テキストのクロスアテンションは凍結し、ベースモデルの言語誘導力を保ちます。 📐 Video-Reference DualRoPE 参照トークンを動画トークンとは別のRoPE空間に割り当て、被写体レベルの精密な空間制御を実現。動画は時間インデックス1から、参照は0固定で、複数被写体や同一被写体の複数画像を位置オフセットで整理します。 🔗 Cross-Pair Consistent Loss 同一タイムステップで2種類の参照セットを使って学習し、単一フレームへの過学習を抑制。無関係なビジュアル属性に左右されない被写体本来の特徴を抽出します。 クロスドメイン被写体一貫性はCD-Score 0.861でSOTA比+18.7%(Kling 1.6は0.725)。実写⇔ファンタジーの作風変換に強い、実用性の高い一本だと感じます。 #動画生成# #生成AI#
もっと見る
「人間によるイラスト × 人間による音楽 x AI」 歌と映像で物語を紡ぐプロジェクト
Marimosty(まりもすてぃ) うやむや 02: ボーカル Voice: marimo Illustration: Mini Tadokoro (@minimilk) Music & Production: Hiroshi Sekita (@fireflower) Video Generation: Seedance 2.0 Video Editing: Wondershare Filmora 🎬YouTube link in the reply↓
もっと見る
「人間によるイラスト × 人間による音楽 × AI」歌と映像で物語を紡ぐプロジェクト『Marimosty』 オリジナル曲MV公開🌟 Turn on CC for Eng/Romaji/Jpn subtitles! YouTubeの字幕(CC)オンで歌詞が表示されます!! Wake me up!! [Original Song] 【Credits】 Music & Lyrics: Hiroshi Sekita Vocal: marimo Lead guitars: GA Cool (@gacool) Bass, rhythm guitars & all other instruments: Hiroshi Sekita Illustration & Character Design: Mini Tadokoro (@minimilk) Production & Creative Direction: Hiroshi Sekita (@fireflower) Video Generation: Seedance 2.0
もっと見る
動画生成モデルは「正しい映像を作れる」のか、それとも「もっともらしく見える映像を作れる」だけなのか。 これは似ているようで本質的に異なる問いです。物体を正しく配置し物理法則を守りながら複数ステップのタスクを解くこと——これを「視覚的知性(Visual Grounded Intelligence)」と呼ぶならば、現在のモデルはそれを持っているでしょうか。VGI-Benchはその問いに数字で答えます。 27タスク810インスタンスのベンチマークで9つの動画モデルを評価した結果、最強モデルのSeedance 2.0でも全体スコアは51.0%にとどまりました。物理崩壊(非現実的な変形・物体の貫通)、ルール違反(もっともらしい最終状態を出しながら制約を無視)、物体不整合(時間をまたいだ一貫性の喪失)という3つの失敗モードが繰り返し現れます。オープンソース最高のHunyuanVideoは19.1%と商用モデルを大きく下回りました。 より深刻なのは、デノイジング過程の分析が明らかにしたことです。生成中間ステップでの自己修正は全体の1%未満。「誤り→別の誤り」への遷移がデノイジング中盤で23.1%に達しており、後期デノイジングは初期に固定された仮説を磨くだけで誤りを直せていません。さらに、1M合成サンプルによるファインチューニングは計画・空間スキルを改善する一方で時間的・物理的能力を劣化させるというトレードオフも確認されました。VGI-Benchは視覚推論という軸で動画生成の限界を照らし出しています。 タイトル: VGI-Bench: Probing Visual Intelligence in Video Generation Models URL: #動画生成# #視覚推論#
もっと見る