登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 4DReconstruction
4DReconstruction コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
4DReconstruction を含む検索結果
1台のカメラで撮った動画から、遮蔽や激しい変形があっても動く物体を4D(3D+時間)で復元する手法です🎥 タイトル: Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild URL: 🎥 概要 単一視点の3D予測と変形可能な3Dガウシアンスプラッティングを組み合わせた、テスト時最適化フレームワークです。学習済みの幾何・外観の事前知識を映像と統合し、強い遮蔽や非剛体運動に対処します。 ❓ 解決する課題 ・4Dを直接予測する手法は学習データが乏しく汎化が難しい ・3Dを初期化して動画だけで精緻化する手法は、大変形や遮蔽のある実世界映像で破綻しがち 💡 方法論と提案手法 3つの要素で構成されます。 ・Causal Latent Conditioning:画像→3Dモデルを再学習なしで時間方向に整合。隣接フレームの潜在をODEレベルで結合し、t₀で一貫性と各フレーム忠実度を調整 ・変形可能ガウシアン:疎な制御ノード+時間変化するSE(3)変換とLBSで、正準表現を各フレームへ変形 ・遮蔽考慮の精緻化:見えるピクセルだけを比較しつつ、視点条件付き拡散事前分布で未観測面を補完 📊 実験結果 ・ベースライン(STAG4D, PAD3R, L4GM, DreamMesh4D, V2M4, BANMo)と比較 ・Pexelsデータで点追跡誤差EPE 0.072(競合は0.119〜0.211) ・単一H200 GPUで32フレーム動画あたり約30分 #3D再構成# #GaussianSplatting#
もっと見る
スマホで撮った1本の動画から、自由に見回せる「動く3D人物」を作れる——専用スタジオも複数カメラも不要です。 タイトル: 4DAnyone: Create Anyone in 4D from a Casual Monocular Video URL: キャリブレーションなしの単眼動画から、多視点一貫動画を生成して4D Gaussian Splattingへ変換する枠組みです。注目ポイントは3つ。 📦 注目ポイント1: 参照文脈を O(N)→O(1) に圧縮(RCP) 4D再構成には数十視点が必要ですが、生成済み視点を条件に足すほど文脈が肥大化してガイダンスが弱まります。Reference Context Packingは、参照を固定長・混合解像度に圧縮し、視点が増えても計算量を一定に保ちます。 🔄 注目ポイント2: ノイズに応じて視点グループを回す(TCR) 独立にデノイズする視点グループは情報交換できず構造がずれます。Target Context Routingは高ノイズ時にグループを巡回シフトして全体構造を伝播し、低ノイズ時はグループを固定して詳細を安定化。切替は t/T=0.2 が最適でした。 🎮 注目ポイント3: ゲームエンジン製データで実世界へ汎化 自社エンジンの38k本多視点動画(318名・24カメラ)に実写・単眼データを組み合わせ、3段階カリキュラムで学習。結果、生成一貫性でPSNR 24.33を達成し既存手法を明確に上回りました。 スマホ動画から約40分でフォトリアルな4Dアバター。自由視点表現が一般ユーザーの手元に近づきます。 #4DReconstruction# #GaussianSplatting#
もっと見る