登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 3D生成
3D生成 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
3D生成 を含む検索結果
3D生成AIと3Dプリンタの距離が、また少し近づいています。 @MeshyAIのAuto-Repairにより、生成した3Dモデルのジオメトリ問題を検出・修正し、スライサーに渡しやすい穴や隙間のない、3Dプリント向けのメッシュを創れるように。 3Dプリントがもっと楽しみやすくなる。
もっと見る
3Dで制作されたアイソメから無限LOOP動画を生成。 物理的な表現が破綻している点があるが、もう少し細かく設定すると理想に近づきそう。 明日も、もう少しチャレンジしてみる。
もっと見る
AI生成の3Dモデルを「印刷できるパーツ」に近づける。 @MeshyAI Auto Splitでは、I-2-3Dで作ったドラフトモデルを、モデルの自然な構造に沿って分割。 これまで手作業で調整していた分割工程が、かなり短縮されそうです。 気になるコネクターも近日公開予定とのこと。
もっと見る
🧊 1枚の画像から3Dを作るとき、「見えている面は正確だが裏側は作れない」か「完全だが入力とズレる」かの二択でした。World Tracingは、ピクセルごとに3D点を層状に積み上げて、見える面と隠れた面を同時に手に入れます。 タイトル: World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible URL: 🔍 概要 World Tracingは、各ピクセルに対しカメラ空間の3D点を順序付きでL個積層する表現です。第0層が見える表面、深い層が前景の裏に隠れた面との前後交差を記録し、忠実な再構成と生成的な補完を1つの層状問題として統合します。 ❓ 解決する課題 従来のimage-to-3Dには根本的なトレードオフがありました。 ・深度推定器はピクセルに正確だが、見える表面で止まる ・生成3Dモデルは完全だが、正準座標で動くため入力とズレる World Tracingは「見える面を正確に再構成しつつ見えない面をもっともらしく生成する」忠実な生成として定式化します。 💡 方法論と提案手法 中核は17億パラメータの拡散トランスフォーマWT-DiTです。 ・層内・レイ方向・グローバルの3方向に因子化したアテンションで、深度順序と前後の整合を保つ ・第0層は画像に制約される再構成的、深い層は生成的という非対称性に対し、層ごとにノイズ量を変える混合ノイズスケジュールを導入 ・多層(3Dアセット)と単層(RGBD写真)の教師を同時に使える混合学習 🎯 ユースケース ・テキスト駆動の3Dシーン編集(ピクセル整列なので再学習なしのクローズドフォーム合成) ・完全な裏側形状をメモリに使う、ジオメトリ条件付きの新視点ビデオ生成 ・TRELLISと組み合わせ、入力に正しく再投影される忠実なメッシュ生成 📊 実験結果 オブジェクト・シーン・動的の各ベンチで既存手法を上回りました。 ・オブジェクト可視深度MAE 0.0149(VGGT 0.0257) ・完全形状F-score@0.05 0.549(TRELLIS 0.204) ・シーンMAE 0.0102、動的クリップChamfer L2 0.0105で最良 #3D生成# #CV#
もっと見る
🪑 画像に物を「3Dの向きと位置まで指定して」自然に挿入。テキストでは曖昧、パラメータでは難しかった3D姿勢制御を、視覚プロキシの分解で解いた手法DIRECTです。 タイトル: Direct 3D-Aware Object Insertion via Decomposed Visual Proxies URL: 📝 概要 DIRECTは、参照オブジェクトを画像へ挿入する際に、3Dの姿勢と位置を明示的に制御できる拡散ベースの手法です。挿入条件を幾何・外観・文脈の3つに分解し、独立した経路で注入します。 ❓ 解決する課題 既存の挿入手法は2Dインペインティングとして定式化され、3D姿勢を制御できませんでした。テキスト誘導は空間的に曖昧、パラメトリックな3D手法は抽象パラメータを正しい幾何投影へ翻訳できない、という限界がありました。 💡 方法論と提案手法 ・ユーザーが操作する3Dプロキシを目標姿勢でレンダリングし幾何ガイダンスを得ます ・外観(参照の高忠実度な見た目)と文脈(背景の意味)を、別々のLoRAと位置埋め込みで独立注入し特徴のもつれを防ぎます ・TRELLISで画像から粗い3Dを生成し、VGGTと3D Gaussian Splattingで姿勢を精緻化します ・FLUX.1-Fill上に構築し、形状分解マスク拡張と漸進的解像度学習で過学習を防ぎます 🎯 ユースケース バーチャルステージング、EC商品撮影、精密な空間制御が要るクリエイティブ制作、フォトリアルなAR/VRコンテンツ生成などに使えます。 📊 実験結果 ・FLUXベースでPSNR 23.09、LPIPS 0.147、マッチング誤差17.8と、ベースラインを全指標で上回りました ・0°〜180°の大きな姿勢変化でも安定し、3D再構成の劣化にも頑健に細部を保持しました ・ハイブリッドデータ学習でCLIP-Iが0.904→0.943に向上しました ・対称オブジェクトの向き付けでは、RGB幾何ガイダンスが法線マップを上回ることも示しました #3DGeneration# #ImageEditing#
もっと見る
動画生成モデルで4D世界を作るとき、わざわざRGBに戻す必要はなかった——潜在空間から直接4Dへ変換する新手法が登場しました。 Beyond Pixels: From Video Priors to 4D Worlds 🔍 概要 従来の「動画生成→RGB→4D再構成」という3段階カスケードは、RGB変換でVAE潜在空間の幾何学情報を失い、アーティファクトを増幅させる構造的な問題を抱えていました。本研究は動画VAEの最終デノイズ済み潜在を直接4Dデコーダーに接続する「latent-to-4D生成」を提案します。 🛠 解決する課題 ・RGBデコード時に幾何学情報が劣化する ・ジェネレーター固有ノイズがRGB経由で4D再構成に伝播する ・ジェネレーターが変わるたびに4Dモジュールを再学習する必要がある これらすべてを、VAE潜在空間を直接インターフェースにすることで回避します。 ⚙ 方法論と提案手法 3つのコンポーネントで構成されます。 ・アライメントモジュール(𝒜ϕ):三線形リサンプリングと3D畳み込みで潜在を4Dデコーダーのトークン空間に変換 ・L4ARアテンション:フレームワイズ空間整合 + グローバル時間アテンションの階層的組み合わせ ・4Dデコーダー:カメラパラメータ(9D)と密な世界座標系ポイントマップを同時予測 学習対象はこの3コンポーネントのみ(rank-16 LoRA含む)。VAEやTransformer本体は凍結し、約1,000クリップで学習します。 📊 実験結果 DINO-F1スコア(テキスト→4D):57.01〜57.09(本手法)対 53.27〜54.21(カスケードベースライン)。画像→4Dでは61.60対55.79で5.81ポイント改善。人間評価でも幾何学・完全性で66.8〜72.1%の好みを得ています。頑健性テストでは汚染レベルρ=0.6時のドリフトが0.0053(ベースライン比71倍の安定性)を記録しました。 🌐 汎用性 14Bと1.3Bの2サイズのWan T2VモデルおよびWan I2Vモデルで、単一チェックポイントが変更なしに動作。モーション・外観・カメラ制御もそのまま引き継がれます。 #4D生成# #動画AI#
もっと見る
◤無料オンラインセミナー開催◢ AI映像制作の最前線をnpaka氏と検証 はじめてのAutodesk Flow Studio 🔽7/15(水)開催!お申し込みはこちらから ・実写映像の人物を3Dキャラクターに置き換え ・動画からモーションを抽出 ・映像から3Dシーンを生成
もっと見る
【香港IPO】阿里巴巴投資的3D建模初創公司Vast考慮香港IPO 知情人士稱,中國3D建模初創公司Vast正在考慮香港IPO。Vast正在與美國銀行和中金公司就股票發行計劃進行合作。Vast的投資方包括阿里巴巴、百度和渶策資本。旗下產品Tripo Studio可根據文字及圖像提示詞生成3D模型。
もっと見る
1時間以上のインタラクティブ世界を、単一GPUで生成し続けられる——そんな世界モデルが登場しました。 Alaya-EVOKE: From Linear-Scaling Supervision to Endless World 動画世界モデルの核心技術を3つに絞り込み、徹底的に深掘りします。 🗺 注目ポイント1:外部幾何学メモリによるO(1)コンテキスト 従来の世界モデルは生成が長くなるほどトランスフォーマーの文脈長が爆発し、実質的に数分が限界でした。EVOKEは生成フレームから単眼深度推定を行い、カメラポーズでインデックスした「ワールドステートバンク」に3D点群として外部保存します。次チャンク生成時はバンクから必要な幾何学情報を検索してデノイザーに注入するため、セッションが65分を超えても各コールの入力サイズは1.5秒(9フレーム)のまま一定です。「セッション長は再帰コールの回数のみを増やし、各コールのコンテキスト長は一切増やさない」という設計が鍵です。 🎓 注目ポイント2:監督ホライゾンと勾配ホライゾンの分離 長期的な一貫性には長いホライゾンで監督する必要がありますが、バックプロパゲーションのメモリが問題でした。EVOKEは14B Wan2.2教師モデルを設計し、「教師は完全軌跡を評価するが、学生の勾配計算はチャンクごとに切り離す」という手法で解決します。制御実験では、長ホライゾン教師(30秒監督)の学生は輝度が101%で安定、短ホライゾン教師の学生は74%に下落(Wilcoxon p=0.016)。長い教師監督が長期一貫性の「要」であることが統計的に証明されました。 ⚡ 注目ポイント3:CFGなし3ステップ推論でVBench-2.0首位 CFG(Classifier-Free Guidance)を一切使わず、粗→細の潜在ピラミッドで3回のデノイジングのみ。それでもVBench-2.0でスコア66.77(10システム中1位)を達成し、多ステップシステムと同等品質を実現。1チャンク(1.5秒)の生成時間はH200 1枚で2.11秒です。 「持続的状態とデノイザーコンテキストのデカップリング」という発想の転換が、時間軸で破綻しない世界モデルへの道を開きました。 #世界モデル# #動画生成AI#
もっと見る
🏠 テキストや画像で家具を指定するだけで、スタイルの揃った3D屋内シーンを自動生成。しかもMMGDreamer比で約85%高速です。 タイトル: FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow URL: 📝 概要 FlowSceneは、テキストと画像を融合したマルチモーダルなシーングラフから、高忠実度の3D屋内シーンを生成する手法です。配置・形状・テクスチャの3ブランチを、直線的なRectified Flowで同時に生成し、シーン全体でスタイルの一貫性を保ちます。 ❓ 解決する課題 言語駆動の検索型はオブジェクト単位の制御やスタイル一貫性に弱く、グラフベース型は高品質なテクスチャ生成が苦手でした。FlowSceneはこの両者の弱点を同時に解消します。 💡 方法論と提案手法 ・ノードがテキスト記述と画像特徴を融合できるマルチモーダルグラフを入力にします(テキストのみ・画像のみ・混在に対応) ・サンプリング中にノード情報を密に交換するInfoExchangeUnitで、個別条件と全体条件を両立させます ・配置(3Dボックス)、形状(VQ-VAE潜在)、テクスチャ(幾何にアンカー)を独立デノイザで生成します ・テクスチャは幾何を固定したまま外観だけをデノイズし、テキストのみのノードにもスタイル一貫したテクスチャを合成します 🎯 ユースケース インテリアデザインや製造での対話的なシーン設計、VR/ARコンテンツ制作、ロボティクスのシミュレーション環境づくりなどに使えます。 📊 実験結果 ・FID(寝室)が42.38→35.01とMMGDreamer比17.4%改善 ・CLIPScore 0.2386で全手法中最高、スタイル一貫性のユーザー評価も8.72/10 ・推論時間はテクスチャなしで6.83秒と、MMGDreamerの45.34秒より約85%高速 ・ナイトスタンドの最小マッチング距離を43.90%改善するなど、オブジェクト品質も向上しました #3DGeneration# #GenerativeAI#
もっと見る