登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 動画生成
動画生成 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
動画生成 を含む検索結果
動画生成AIが物を壁の後ろに隠すと、なぜか別の物になって出てくる。この「物体永続性」の欠陥に真正面から挑んだ研究です。 タイトル: Training Object Permanence in World Models URL: 📝 概要 人間の乳児が生後半年で獲得する「物体永続性」と「物体の固体性」を、動画生成モデルに学習させる取り組みです。150種の合成タスクから150万件の学習データと評価ベンチマークWROPを作り、160億パラメータのモデルPWM-WROPを構築しました。 ❓ 解決する課題 Sora等の動画生成モデルは、物体が遮蔽物の後ろで消えたまま別物として再出現したり、固体の壁を平気で貫通したりします。この欠陥が衝突や因果関係の推論全体を損なっていました。 💡 方法論と提案手法 Blenderで生成した150種のタスクを「遮蔽」「固体性」の6ファミリーに整理し、物体数や軌道などの構造パラメータは体系的に変え、色や照明などの表面パラメータはランダム化することで記憶による解答を防ぎます。これをCosmos3-Nanoにファインチューニングしました。 📊 実験結果 人間による361件のペア比較評価で、PWM-WROPは真の継続生成モデルの中で1位(Elo 1679.5)、次点に224ポイント差をつけました。静的遮蔽タスクでは全モデル中1位を獲得した一方、衝突などの固体性タスクでは苦戦が見られました。 🌍 ユースケース 学習データ・モデル重み・AWS Trainium2向けの学習基盤PWMを公開し、物理的に妥当な世界モデル構築の土台を提供します。 #世界モデル# #動画生成AI#
もっと見る
動画生成AIに複数ステップで考える力を持たせる新手法HDR(Hierarchical Denoising for Visual Reasoning)が発表された(https://arxiv[.]org/html/2607.15278v1)。 いまの動画生成AIの多くは拡散モデル(ランダムなノイズを少しずつクリアな映像に近づけていく生成の仕組み)を使っていて、迷路やハノイの塔のような視覚的な推論もできるようになってきた。ただし既存の生成方式には弱点がある。ストリーミング型(過去のフレームだけを見て左から右へ逐次生成する方式、CausVidなど)は速いが、一度生成したフレームを後から直せず序盤の判断ミスを引きずる。双方向型(動画全体を毎ステップまとめてノイズ除去する方式)は前の判断を修正できて賢いが、毎回全フレームを更新するので計算コストが重くストリーミングに向かない。 HDRは動画の潜在表現(モデル内部で圧縮された動画データ)を6段階の木構造の階層に組む。粗いレベルはノイズを多めに残して複数の可能性を保持したまま大枠の計画を立て、細かいレベルに降りるほどノイズを削って具体的な映像へ絞り込む。各階層の中は左から右への逐次生成を保つのでストリーミングの速さはそのまま。SHAP(疎な階層的注意機構、各フレームが近くのフレームと一つ上の階層だけを参照して計算量を抑える仕組み)も導入している。論文では、既存方式が迷路で序盤に間違った分岐を選んで失敗するのに対し、HDRは分岐の判断を保留してから細部を詰めて正解にたどり着く例が紹介されている。 迷路・ハノイの塔・一筆書き・スライドパズル・倉庫番・水注ぎの6タスク、370本の評価動画によるベンチマークでは、ストリーミング型ベースライン(CausalForcing)比で成功率が34.22から60.29へ(76.2%の相対改善)、平均進捗スコアも76.00から89.56へ向上。推論速度は1フレームあたり0.70秒で、双方向型(37.92秒)より54.2倍速いのにストリーミング型ベースライン(0.72秒)とほぼ同速。学習データを2%に絞っても82.9%の成功率を維持できており(双方向型は52.0%まで低下)、データ効率の高さも見どころ。実機ロボットアームの迷路実験でも同じ枠組みが機能したという。
もっと見る
【新機能】#動画生成AI# の編集フローを効率化🎬 (株)Mavericksは、動画生成AI「NoLang」のAPIをアップデート。 API経由で自動生成した動画をWeb上でそのまま視聴・編集・ダウンロードできるようになり、「自動生成×手動仕上げ」をシームレスに実現する。 @sayhi2ai_jp
もっと見る
動画生成モデルは「正しい映像を作れる」のか、それとも「もっともらしく見える映像を作れる」だけなのか。 これは似ているようで本質的に異なる問いです。物体を正しく配置し物理法則を守りながら複数ステップのタスクを解くこと——これを「視覚的知性(Visual Grounded Intelligence)」と呼ぶならば、現在のモデルはそれを持っているでしょうか。VGI-Benchはその問いに数字で答えます。 27タスク810インスタンスのベンチマークで9つの動画モデルを評価した結果、最強モデルのSeedance 2.0でも全体スコアは51.0%にとどまりました。物理崩壊(非現実的な変形・物体の貫通)、ルール違反(もっともらしい最終状態を出しながら制約を無視)、物体不整合(時間をまたいだ一貫性の喪失)という3つの失敗モードが繰り返し現れます。オープンソース最高のHunyuanVideoは19.1%と商用モデルを大きく下回りました。 より深刻なのは、デノイジング過程の分析が明らかにしたことです。生成中間ステップでの自己修正は全体の1%未満。「誤り→別の誤り」への遷移がデノイジング中盤で23.1%に達しており、後期デノイジングは初期に固定された仮説を磨くだけで誤りを直せていません。さらに、1M合成サンプルによるファインチューニングは計画・空間スキルを改善する一方で時間的・物理的能力を劣化させるというトレードオフも確認されました。VGI-Benchは視覚推論という軸で動画生成の限界を照らし出しています。 タイトル: VGI-Bench: Probing Visual Intelligence in Video Generation Models URL: #動画生成# #視覚推論#
もっと見る
PR【Topview(@topviewAIJP)】#MotionStudio# 公式の投稿文をプロンプトに入力してWan3.0 Primeを使って30秒のモーショングラフィックスを生成。 テンプレートが複数用意されてるので、そのまま使うも良し、生成結果を見て修正をしていくも良し。 #TopviewAI# #AIMotionVideo# #AIVideo# #AI動画生成#
もっと見る
下に何があるか、見てみたい?👀 どんな写真でも スムーズでリアルな動きのあるNSFW動画に変換できるよ🔞 初回は100%無料🔥 ログインするだけで毎日無料クレジットもGET! 今すぐ試す → #NSFW# #AIvideo# #MotionAI# #Undress# #NSFWAI# #AI動画# #NSFW動画生成# #裏垢女子#
もっと見る
【🎬しにがみポロライド】 ― seedance2.0 / #TapNow# 『COLOTEK』コンテスト用! フルAIアニメ! 良き仕上がりになったと思います! ぜひ音ありで聞いてみてください📢 --- ここから余談w AI映像界隈、 チーム制作の話をよく聞きますが、 このAIアニメ、全ての工程において、 完全に『一人』で作ってます! 企画~世界観設計~脚本~AI動画生成~編集 全て一人、 私たなか のみです! もちろん、エージェントを使いながら! そして、他の参加者の方も、 個人参戦は多いと思います! AI時代、 個人でもまだまだやれまっせ! そんな希望になる作品に、 なれば嬉しいです!
もっと見る
動画生成モデルで4D世界を作るとき、わざわざRGBに戻す必要はなかった——潜在空間から直接4Dへ変換する新手法が登場しました。 Beyond Pixels: From Video Priors to 4D Worlds 🔍 概要 従来の「動画生成→RGB→4D再構成」という3段階カスケードは、RGB変換でVAE潜在空間の幾何学情報を失い、アーティファクトを増幅させる構造的な問題を抱えていました。本研究は動画VAEの最終デノイズ済み潜在を直接4Dデコーダーに接続する「latent-to-4D生成」を提案します。 🛠 解決する課題 ・RGBデコード時に幾何学情報が劣化する ・ジェネレーター固有ノイズがRGB経由で4D再構成に伝播する ・ジェネレーターが変わるたびに4Dモジュールを再学習する必要がある これらすべてを、VAE潜在空間を直接インターフェースにすることで回避します。 ⚙ 方法論と提案手法 3つのコンポーネントで構成されます。 ・アライメントモジュール(𝒜ϕ):三線形リサンプリングと3D畳み込みで潜在を4Dデコーダーのトークン空間に変換 ・L4ARアテンション:フレームワイズ空間整合 + グローバル時間アテンションの階層的組み合わせ ・4Dデコーダー:カメラパラメータ(9D)と密な世界座標系ポイントマップを同時予測 学習対象はこの3コンポーネントのみ(rank-16 LoRA含む)。VAEやTransformer本体は凍結し、約1,000クリップで学習します。 📊 実験結果 DINO-F1スコア(テキスト→4D):57.01〜57.09(本手法)対 53.27〜54.21(カスケードベースライン)。画像→4Dでは61.60対55.79で5.81ポイント改善。人間評価でも幾何学・完全性で66.8〜72.1%の好みを得ています。頑健性テストでは汚染レベルρ=0.6時のドリフトが0.0053(ベースライン比71倍の安定性)を記録しました。 🌐 汎用性 14Bと1.3Bの2サイズのWan T2VモデルおよびWan I2Vモデルで、単一チェックポイントが変更なしに動作。モーション・外観・カメラ制御もそのまま引き継がれます。 #4D生成# #動画AI#
もっと見る