1台のカメラで撮った動画から、遮蔽や激しい変形があっても動く物体を4D(3D+時間)で復元する手法です🎥
タイトル: Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild
URL:
🎥 概要
単一視点の3D予測と変形可能な3Dガウシアンスプラッティングを組み合わせた、テスト時最適化フレームワークです。学習済みの幾何・外観の事前知識を映像と統合し、強い遮蔽や非剛体運動に対処します。
❓ 解決する課題
・4Dを直接予測する手法は学習データが乏しく汎化が難しい
・3Dを初期化して動画だけで精緻化する手法は、大変形や遮蔽のある実世界映像で破綻しがち
💡 方法論と提案手法
3つの要素で構成されます。
・Causal Latent Conditioning:画像→3Dモデルを再学習なしで時間方向に整合。隣接フレームの潜在をODEレベルで結合し、t₀で一貫性と各フレーム忠実度を調整
・変形可能ガウシアン:疎な制御ノード+時間変化するSE(3)変換とLBSで、正準表現を各フレームへ変形
・遮蔽考慮の精緻化:見えるピクセルだけを比較しつつ、視点条件付き拡散事前分布で未観測面を補完
📊 実験結果
・ベースライン(STAG4D, PAD3R, L4GM, DreamMesh4D, V2M4, BANMo)と比較
・Pexelsデータで点追跡誤差EPE 0.072(競合は0.119〜0.211)
・単一H200 GPUで32フレーム動画あたり約30分
#
3D再構成# #
GaussianSplatting#