登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 4D生成
4D生成 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
4D生成 を含む検索結果
動画生成モデルで4D世界を作るとき、わざわざRGBに戻す必要はなかった——潜在空間から直接4Dへ変換する新手法が登場しました。 Beyond Pixels: From Video Priors to 4D Worlds 🔍 概要 従来の「動画生成→RGB→4D再構成」という3段階カスケードは、RGB変換でVAE潜在空間の幾何学情報を失い、アーティファクトを増幅させる構造的な問題を抱えていました。本研究は動画VAEの最終デノイズ済み潜在を直接4Dデコーダーに接続する「latent-to-4D生成」を提案します。 🛠 解決する課題 ・RGBデコード時に幾何学情報が劣化する ・ジェネレーター固有ノイズがRGB経由で4D再構成に伝播する ・ジェネレーターが変わるたびに4Dモジュールを再学習する必要がある これらすべてを、VAE潜在空間を直接インターフェースにすることで回避します。 ⚙ 方法論と提案手法 3つのコンポーネントで構成されます。 ・アライメントモジュール(𝒜ϕ):三線形リサンプリングと3D畳み込みで潜在を4Dデコーダーのトークン空間に変換 ・L4ARアテンション:フレームワイズ空間整合 + グローバル時間アテンションの階層的組み合わせ ・4Dデコーダー:カメラパラメータ(9D)と密な世界座標系ポイントマップを同時予測 学習対象はこの3コンポーネントのみ(rank-16 LoRA含む)。VAEやTransformer本体は凍結し、約1,000クリップで学習します。 📊 実験結果 DINO-F1スコア(テキスト→4D):57.01〜57.09(本手法)対 53.27〜54.21(カスケードベースライン)。画像→4Dでは61.60対55.79で5.81ポイント改善。人間評価でも幾何学・完全性で66.8〜72.1%の好みを得ています。頑健性テストでは汚染レベルρ=0.6時のドリフトが0.0053(ベースライン比71倍の安定性)を記録しました。 🌐 汎用性 14Bと1.3Bの2サイズのWan T2VモデルおよびWan I2Vモデルで、単一チェックポイントが変更なしに動作。モーション・外観・カメラ制御もそのまま引き継がれます。 #4D生成# #動画AI#
もっと見る
スマホで撮った1本の動画から、自由に見回せる「動く3D人物」を作れる——専用スタジオも複数カメラも不要です。 タイトル: 4DAnyone: Create Anyone in 4D from a Casual Monocular Video URL: キャリブレーションなしの単眼動画から、多視点一貫動画を生成して4D Gaussian Splattingへ変換する枠組みです。注目ポイントは3つ。 📦 注目ポイント1: 参照文脈を O(N)→O(1) に圧縮(RCP) 4D再構成には数十視点が必要ですが、生成済み視点を条件に足すほど文脈が肥大化してガイダンスが弱まります。Reference Context Packingは、参照を固定長・混合解像度に圧縮し、視点が増えても計算量を一定に保ちます。 🔄 注目ポイント2: ノイズに応じて視点グループを回す(TCR) 独立にデノイズする視点グループは情報交換できず構造がずれます。Target Context Routingは高ノイズ時にグループを巡回シフトして全体構造を伝播し、低ノイズ時はグループを固定して詳細を安定化。切替は t/T=0.2 が最適でした。 🎮 注目ポイント3: ゲームエンジン製データで実世界へ汎化 自社エンジンの38k本多視点動画(318名・24カメラ)に実写・単眼データを組み合わせ、3段階カリキュラムで学習。結果、生成一貫性でPSNR 24.33を達成し既存手法を明確に上回りました。 スマホ動画から約40分でフォトリアルな4Dアバター。自由視点表現が一般ユーザーの手元に近づきます。 #4DReconstruction# #GaussianSplatting#
もっと見る
【出展】6/10から幕張メッセで開催されるInterop Tokyo 2026で構築されるShowNetにおいて、PFNが開発するAIプロセッサーMN-Core 2の水冷サーバー、生成AI基盤モデルPLaMo 3.0 Prime βを動態展示して、先進的なネットワーク運用実証に参加します。(ホール4・D-5ラック) #shownet# #inteop26#
もっと見る
4Dに限らずだけど、映画見る時は必ずメガネ拭きをポケットに忍ばせてる。特に4DXは濡れる可能性もあるからね…
手ブレとの戦いは、Ronin 4Dでついに終わる🎥 Z軸まで制御する4軸ジンバルで、縦揺れもヌルッと消える。 カメラ部を切り離せるデザインのおかげで、どんな現場でも動きが自由自在✨ この滑らかな動き…あの動物🐔に見えてきた人、正解!
もっと見る
1台のカメラで撮った動画から、遮蔽や激しい変形があっても動く物体を4D(3D+時間)で復元する手法です🎥 タイトル: Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild URL: 🎥 概要 単一視点の3D予測と変形可能な3Dガウシアンスプラッティングを組み合わせた、テスト時最適化フレームワークです。学習済みの幾何・外観の事前知識を映像と統合し、強い遮蔽や非剛体運動に対処します。 ❓ 解決する課題 ・4Dを直接予測する手法は学習データが乏しく汎化が難しい ・3Dを初期化して動画だけで精緻化する手法は、大変形や遮蔽のある実世界映像で破綻しがち 💡 方法論と提案手法 3つの要素で構成されます。 ・Causal Latent Conditioning:画像→3Dモデルを再学習なしで時間方向に整合。隣接フレームの潜在をODEレベルで結合し、t₀で一貫性と各フレーム忠実度を調整 ・変形可能ガウシアン:疎な制御ノード+時間変化するSE(3)変換とLBSで、正準表現を各フレームへ変形 ・遮蔽考慮の精緻化:見えるピクセルだけを比較しつつ、視点条件付き拡散事前分布で未観測面を補完 📊 実験結果 ・ベースライン(STAG4D, PAD3R, L4GM, DreamMesh4D, V2M4, BANMo)と比較 ・Pexelsデータで点追跡誤差EPE 0.072(競合は0.119〜0.211) ・単一H200 GPUで32フレーム動画あたり約30分 #3D再構成# #GaussianSplatting#
もっと見る
/ 「#三宅健-4Dimensions-スペイン編」放送決定!# \ 未公開SP🇪🇸&フランス編🇫🇷と合わせて全話一挙放送 4時間半の永久保存版✨ 🗓️7/25(土)12:30~ フジテレビTWO スペイン編は地上波特別編集版も 🗓️7/2(木) 25:00~ フジテレビ(関東ローカル) #三宅健_4D# @kenmiyake_idol
もっと見る
ウーノから4Dオールインワンシャンプー登場! シャンプー・トリートメント・スカルプケア・ベースデザインの4in1処方 濃密な泡でダメージレス&一度ですっきり洗浄。 これ一本で今も未来もキマる髪へ。
もっと見る
ウーノから4Dオールインワンシャンプー登場! シャンプー・トリートメント・スカルプケア・ベースデザインの4in1処方 濃密な泡でダメージレス&一度ですっきり洗浄。 これ一本で今も未来もキマる髪へ。
もっと見る
ウーノから4Dオールインワンシャンプー登場! シャンプー・トリートメント・スカルプケア・ベースデザインの4in1処方 濃密な泡でダメージレス&一度ですっきり洗浄。 これ一本で今も未来もキマる髪へ。
もっと見る