🎬 参照画像の被写体を保ったまま、実写⇔ファンタジーのドメインをまたいで動画化できる被写体駆動T2Vです。
タイトル: DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
URL:
被写体の「忠実度」と「スタイル適応の柔軟性」を両立させたDomainShuttle。注目したい3点を紹介します。
🧬 Domain-MoT
動画と参照画像を独立2ブランチで処理し、参照側は時間に加えてドメイン属性(実在人物/物体/背景/ファンタジー)で変調するDomain-aware AdaLNを採用。テキストのクロスアテンションは凍結し、ベースモデルの言語誘導力を保ちます。
📐 Video-Reference DualRoPE
参照トークンを動画トークンとは別のRoPE空間に割り当て、被写体レベルの精密な空間制御を実現。動画は時間インデックス1から、参照は0固定で、複数被写体や同一被写体の複数画像を位置オフセットで整理します。
🔗 Cross-Pair Consistent Loss
同一タイムステップで2種類の参照セットを使って学習し、単一フレームへの過学習を抑制。無関係なビジュアル属性に左右されない被写体本来の特徴を抽出します。
クロスドメイン被写体一貫性はCD-Score 0.861でSOTA比+18.7%(Kling 1.6は0.725)。実写⇔ファンタジーの作風変換に強い、実用性の高い一本だと感じます。
#
動画生成# #
生成AI#