登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 動画AI
動画AI コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
動画AI を含む検索結果
動画AIは、ブレた・遮蔽された映像も「等しく信じて」推論していました。その盲点に切り込む研究です。 タイトル:Confidence-Aware Tool Orchestration for Robust Video Understanding URL: ❓ 何が問題なの? 💡 Video-LLMは全フレームを等しく信頼できると暗黙に仮定しています(著者の言う「Blind Trust Problem」)。モーションブラーやグレア、遮蔽で映像が劣化しても気づかず、実世界ベンチで15〜30ポイントも精度が落ちます。しかも確信度はほぼ変わらない「静かな失敗」が起きます。 ❓ Robust-TOはどう解くの? 💡 フレーム単位の信頼度を推論の全段階に組み込みます。まず品質プロファイリングでブラー・輝度・遮蔽を採点して信頼できるフレームだけ選び、次にクエリをサブクエリに分解して劣化に強いツールへ振り分け、各ツールは(結果, 確信度)のペアを返します。 ❓ 確信度はどう使うの? 💡 証拠をhigh/medium/lowの3段階に分類。highで結論を出し、mediumは一致時のみ採用、lowは代替手段としてだけ使い、残る不確実性は回答に明記します。確信度-コスト報酬を含むGRPOで学習します。 ❓ どれくらい効くの? 💡 クリーン動画で平均56.4%(Gemini-2.5-Proを+10.6pt)、劣化動画で54.3%(オープンソース最強Video-R1を+5.8pt)。しかもフレームを32→20.7枚に絞り、推論を35%以上高速化しつつ精度+1.6ptも達成しています。 #動画理解# #マルチモーダルAI#
もっと見る
#AI動画# #Aipictors# #海賊# ピクターズのお題「かっこいいキャラクター」 Google Flowで作ったらセリフが英語?になってしまいました
#AI動画# #Aipictors# #星空# ピクターズのお題「夜景」 夜のビーチで見る星空
#AI動画# #Aipictors# #キャンプ# ピクターズのお題「山」 キャンプは大変そうだけど、自然の中でビールと肉は味わいたい
動画生成モデルで4D世界を作るとき、わざわざRGBに戻す必要はなかった——潜在空間から直接4Dへ変換する新手法が登場しました。 Beyond Pixels: From Video Priors to 4D Worlds 🔍 概要 従来の「動画生成→RGB→4D再構成」という3段階カスケードは、RGB変換でVAE潜在空間の幾何学情報を失い、アーティファクトを増幅させる構造的な問題を抱えていました。本研究は動画VAEの最終デノイズ済み潜在を直接4Dデコーダーに接続する「latent-to-4D生成」を提案します。 🛠 解決する課題 ・RGBデコード時に幾何学情報が劣化する ・ジェネレーター固有ノイズがRGB経由で4D再構成に伝播する ・ジェネレーターが変わるたびに4Dモジュールを再学習する必要がある これらすべてを、VAE潜在空間を直接インターフェースにすることで回避します。 ⚙ 方法論と提案手法 3つのコンポーネントで構成されます。 ・アライメントモジュール(𝒜ϕ):三線形リサンプリングと3D畳み込みで潜在を4Dデコーダーのトークン空間に変換 ・L4ARアテンション:フレームワイズ空間整合 + グローバル時間アテンションの階層的組み合わせ ・4Dデコーダー:カメラパラメータ(9D)と密な世界座標系ポイントマップを同時予測 学習対象はこの3コンポーネントのみ(rank-16 LoRA含む)。VAEやTransformer本体は凍結し、約1,000クリップで学習します。 📊 実験結果 DINO-F1スコア(テキスト→4D):57.01〜57.09(本手法)対 53.27〜54.21(カスケードベースライン)。画像→4Dでは61.60対55.79で5.81ポイント改善。人間評価でも幾何学・完全性で66.8〜72.1%の好みを得ています。頑健性テストでは汚染レベルρ=0.6時のドリフトが0.0053(ベースライン比71倍の安定性)を記録しました。 🌐 汎用性 14Bと1.3Bの2サイズのWan T2VモデルおよびWan I2Vモデルで、単一チェックポイントが変更なしに動作。モーション・外観・カメラ制御もそのまま引き継がれます。 #4D生成# #動画AI#
もっと見る
動画生成AIに複数ステップで考える力を持たせる新手法HDR(Hierarchical Denoising for Visual Reasoning)が発表された(https://arxiv[.]org/html/2607.15278v1)。 いまの動画生成AIの多くは拡散モデル(ランダムなノイズを少しずつクリアな映像に近づけていく生成の仕組み)を使っていて、迷路やハノイの塔のような視覚的な推論もできるようになってきた。ただし既存の生成方式には弱点がある。ストリーミング型(過去のフレームだけを見て左から右へ逐次生成する方式、CausVidなど)は速いが、一度生成したフレームを後から直せず序盤の判断ミスを引きずる。双方向型(動画全体を毎ステップまとめてノイズ除去する方式)は前の判断を修正できて賢いが、毎回全フレームを更新するので計算コストが重くストリーミングに向かない。 HDRは動画の潜在表現(モデル内部で圧縮された動画データ)を6段階の木構造の階層に組む。粗いレベルはノイズを多めに残して複数の可能性を保持したまま大枠の計画を立て、細かいレベルに降りるほどノイズを削って具体的な映像へ絞り込む。各階層の中は左から右への逐次生成を保つのでストリーミングの速さはそのまま。SHAP(疎な階層的注意機構、各フレームが近くのフレームと一つ上の階層だけを参照して計算量を抑える仕組み)も導入している。論文では、既存方式が迷路で序盤に間違った分岐を選んで失敗するのに対し、HDRは分岐の判断を保留してから細部を詰めて正解にたどり着く例が紹介されている。 迷路・ハノイの塔・一筆書き・スライドパズル・倉庫番・水注ぎの6タスク、370本の評価動画によるベンチマークでは、ストリーミング型ベースライン(CausalForcing)比で成功率が34.22から60.29へ(76.2%の相対改善)、平均進捗スコアも76.00から89.56へ向上。推論速度は1フレームあたり0.70秒で、双方向型(37.92秒)より54.2倍速いのにストリーミング型ベースライン(0.72秒)とほぼ同速。学習データを2%に絞っても82.9%の成功率を維持できており(双方向型は52.0%まで低下)、データ効率の高さも見どころ。実機ロボットアームの迷路実験でも同じ枠組みが機能したという。
もっと見る