登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 GaussianSplatting
GaussianSplatting コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
GaussianSplatting を含む検索結果
スマホで撮った1本の動画から、自由に見回せる「動く3D人物」を作れる——専用スタジオも複数カメラも不要です。 タイトル: 4DAnyone: Create Anyone in 4D from a Casual Monocular Video URL: キャリブレーションなしの単眼動画から、多視点一貫動画を生成して4D Gaussian Splattingへ変換する枠組みです。注目ポイントは3つ。 📦 注目ポイント1: 参照文脈を O(N)→O(1) に圧縮(RCP) 4D再構成には数十視点が必要ですが、生成済み視点を条件に足すほど文脈が肥大化してガイダンスが弱まります。Reference Context Packingは、参照を固定長・混合解像度に圧縮し、視点が増えても計算量を一定に保ちます。 🔄 注目ポイント2: ノイズに応じて視点グループを回す(TCR) 独立にデノイズする視点グループは情報交換できず構造がずれます。Target Context Routingは高ノイズ時にグループを巡回シフトして全体構造を伝播し、低ノイズ時はグループを固定して詳細を安定化。切替は t/T=0.2 が最適でした。 🎮 注目ポイント3: ゲームエンジン製データで実世界へ汎化 自社エンジンの38k本多視点動画(318名・24カメラ)に実写・単眼データを組み合わせ、3段階カリキュラムで学習。結果、生成一貫性でPSNR 24.33を達成し既存手法を明確に上回りました。 スマホ動画から約40分でフォトリアルな4Dアバター。自由視点表現が一般ユーザーの手元に近づきます。 #4DReconstruction# #GaussianSplatting#
もっと見る
1台のカメラで撮った動画から、遮蔽や激しい変形があっても動く物体を4D(3D+時間)で復元する手法です🎥 タイトル: Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild URL: 🎥 概要 単一視点の3D予測と変形可能な3Dガウシアンスプラッティングを組み合わせた、テスト時最適化フレームワークです。学習済みの幾何・外観の事前知識を映像と統合し、強い遮蔽や非剛体運動に対処します。 ❓ 解決する課題 ・4Dを直接予測する手法は学習データが乏しく汎化が難しい ・3Dを初期化して動画だけで精緻化する手法は、大変形や遮蔽のある実世界映像で破綻しがち 💡 方法論と提案手法 3つの要素で構成されます。 ・Causal Latent Conditioning:画像→3Dモデルを再学習なしで時間方向に整合。隣接フレームの潜在をODEレベルで結合し、t₀で一貫性と各フレーム忠実度を調整 ・変形可能ガウシアン:疎な制御ノード+時間変化するSE(3)変換とLBSで、正準表現を各フレームへ変形 ・遮蔽考慮の精緻化:見えるピクセルだけを比較しつつ、視点条件付き拡散事前分布で未観測面を補完 📊 実験結果 ・ベースライン(STAG4D, PAD3R, L4GM, DreamMesh4D, V2M4, BANMo)と比較 ・Pexelsデータで点追跡誤差EPE 0.072(競合は0.119〜0.211) ・単一H200 GPUで32フレーム動画あたり約30分 #3D再構成# #GaussianSplatting#
もっと見る
🪑 画像に物を「3Dの向きと位置まで指定して」自然に挿入。テキストでは曖昧、パラメータでは難しかった3D姿勢制御を、視覚プロキシの分解で解いた手法DIRECTです。 タイトル: Direct 3D-Aware Object Insertion via Decomposed Visual Proxies URL: 📝 概要 DIRECTは、参照オブジェクトを画像へ挿入する際に、3Dの姿勢と位置を明示的に制御できる拡散ベースの手法です。挿入条件を幾何・外観・文脈の3つに分解し、独立した経路で注入します。 ❓ 解決する課題 既存の挿入手法は2Dインペインティングとして定式化され、3D姿勢を制御できませんでした。テキスト誘導は空間的に曖昧、パラメトリックな3D手法は抽象パラメータを正しい幾何投影へ翻訳できない、という限界がありました。 💡 方法論と提案手法 ・ユーザーが操作する3Dプロキシを目標姿勢でレンダリングし幾何ガイダンスを得ます ・外観(参照の高忠実度な見た目)と文脈(背景の意味)を、別々のLoRAと位置埋め込みで独立注入し特徴のもつれを防ぎます ・TRELLISで画像から粗い3Dを生成し、VGGTと3D Gaussian Splattingで姿勢を精緻化します ・FLUX.1-Fill上に構築し、形状分解マスク拡張と漸進的解像度学習で過学習を防ぎます 🎯 ユースケース バーチャルステージング、EC商品撮影、精密な空間制御が要るクリエイティブ制作、フォトリアルなAR/VRコンテンツ生成などに使えます。 📊 実験結果 ・FLUXベースでPSNR 23.09、LPIPS 0.147、マッチング誤差17.8と、ベースラインを全指標で上回りました ・0°〜180°の大きな姿勢変化でも安定し、3D再構成の劣化にも頑健に細部を保持しました ・ハイブリッドデータ学習でCLIP-Iが0.904→0.943に向上しました ・対称オブジェクトの向き付けでは、RGB幾何ガイダンスが法線マップを上回ることも示しました #3DGeneration# #ImageEditing#
もっと見る