登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 3D生成
3D生成 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
3D生成 を含む検索結果
3D生成AIと3Dプリンタの距離が、また少し近づいています。 @MeshyAIのAuto-Repairにより、生成した3Dモデルのジオメトリ問題を検出・修正し、スライサーに渡しやすい穴や隙間のない、3Dプリント向けのメッシュを創れるように。 3Dプリントがもっと楽しみやすくなる。
もっと見る
3Dで制作されたアイソメから無限LOOP動画を生成。 物理的な表現が破綻している点があるが、もう少し細かく設定すると理想に近づきそう。 明日も、もう少しチャレンジしてみる。
もっと見る
AI生成の3Dモデルを「印刷できるパーツ」に近づける。 @MeshyAI Auto Splitでは、I-2-3Dで作ったドラフトモデルを、モデルの自然な構造に沿って分割。 これまで手作業で調整していた分割工程が、かなり短縮されそうです。 気になるコネクターも近日公開予定とのこと。
もっと見る
TL;DR: 長期エージェントの3大問題(誤差蓄積・コンテキスト腐敗・状態消失)を、Manager-Execute-Audit(MEA)ループで構造的に解決。WeaveBenchで51.8%→80.7%を達成しました。 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks ポイント 🔧 Manager: 実行軌跡の外でタスク状態を明示管理。ゴール・受け入れ基準・制約を含む「サブタスクコントラクト」を生成する ⚡ Executor: 過去の軌跡を持ち込まない、バジェット有界の新鮮コンテキストで各サブタスクを実行する 🔍 Auditor: 実行後に読み取り専用で独立検査。完了・整合性・状態更新を3分類でレポートし、ラウンド間の永続メモリとして機能する 🖥️ GUI/CLIハイブリッド: Managerがタスクに応じてインターフェースを選択。AgentAdapterでClaude Code・Codex CLI等を差し替え可能 📊 WeaveBench: PassRate 51.8%→80.7%、Design+60pp・Spatial/3D+50ppの大幅改善 🤖 OSWorld 2.0: Qwen 3.7-Plusで2.8%→8.3%(3倍)、Claude Opus 4.7で20.6%→35.3% 💻 Terminal-Bench: 69.7%→77.2%、かつトークン消費24%減(オーバーヘッドなし) 💡 Manager cost: 総トークンのたった2〜8%。Auditorが19〜38%でほとんどの追加コストを担う 「エージェント能力はモデル単体でなく、モデル+ハーネス全体の性質」——この視点が長期エージェント設計の出発点になると思います。 #AIAgents# #LLM#
もっと見る
🧊 1枚の画像から3Dを作るとき、「見えている面は正確だが裏側は作れない」か「完全だが入力とズレる」かの二択でした。World Tracingは、ピクセルごとに3D点を層状に積み上げて、見える面と隠れた面を同時に手に入れます。 タイトル: World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible URL: 🔍 概要 World Tracingは、各ピクセルに対しカメラ空間の3D点を順序付きでL個積層する表現です。第0層が見える表面、深い層が前景の裏に隠れた面との前後交差を記録し、忠実な再構成と生成的な補完を1つの層状問題として統合します。 ❓ 解決する課題 従来のimage-to-3Dには根本的なトレードオフがありました。 ・深度推定器はピクセルに正確だが、見える表面で止まる ・生成3Dモデルは完全だが、正準座標で動くため入力とズレる World Tracingは「見える面を正確に再構成しつつ見えない面をもっともらしく生成する」忠実な生成として定式化します。 💡 方法論と提案手法 中核は17億パラメータの拡散トランスフォーマWT-DiTです。 ・層内・レイ方向・グローバルの3方向に因子化したアテンションで、深度順序と前後の整合を保つ ・第0層は画像に制約される再構成的、深い層は生成的という非対称性に対し、層ごとにノイズ量を変える混合ノイズスケジュールを導入 ・多層(3Dアセット)と単層(RGBD写真)の教師を同時に使える混合学習 🎯 ユースケース ・テキスト駆動の3Dシーン編集(ピクセル整列なので再学習なしのクローズドフォーム合成) ・完全な裏側形状をメモリに使う、ジオメトリ条件付きの新視点ビデオ生成 ・TRELLISと組み合わせ、入力に正しく再投影される忠実なメッシュ生成 📊 実験結果 オブジェクト・シーン・動的の各ベンチで既存手法を上回りました。 ・オブジェクト可視深度MAE 0.0149(VGGT 0.0257) ・完全形状F-score@0.05 0.549(TRELLIS 0.204) ・シーンMAE 0.0102、動的クリップChamfer L2 0.0105で最良 #3D生成# #CV#
もっと見る
🪑 画像に物を「3Dの向きと位置まで指定して」自然に挿入。テキストでは曖昧、パラメータでは難しかった3D姿勢制御を、視覚プロキシの分解で解いた手法DIRECTです。 タイトル: Direct 3D-Aware Object Insertion via Decomposed Visual Proxies URL: 📝 概要 DIRECTは、参照オブジェクトを画像へ挿入する際に、3Dの姿勢と位置を明示的に制御できる拡散ベースの手法です。挿入条件を幾何・外観・文脈の3つに分解し、独立した経路で注入します。 ❓ 解決する課題 既存の挿入手法は2Dインペインティングとして定式化され、3D姿勢を制御できませんでした。テキスト誘導は空間的に曖昧、パラメトリックな3D手法は抽象パラメータを正しい幾何投影へ翻訳できない、という限界がありました。 💡 方法論と提案手法 ・ユーザーが操作する3Dプロキシを目標姿勢でレンダリングし幾何ガイダンスを得ます ・外観(参照の高忠実度な見た目)と文脈(背景の意味)を、別々のLoRAと位置埋め込みで独立注入し特徴のもつれを防ぎます ・TRELLISで画像から粗い3Dを生成し、VGGTと3D Gaussian Splattingで姿勢を精緻化します ・FLUX.1-Fill上に構築し、形状分解マスク拡張と漸進的解像度学習で過学習を防ぎます 🎯 ユースケース バーチャルステージング、EC商品撮影、精密な空間制御が要るクリエイティブ制作、フォトリアルなAR/VRコンテンツ生成などに使えます。 📊 実験結果 ・FLUXベースでPSNR 23.09、LPIPS 0.147、マッチング誤差17.8と、ベースラインを全指標で上回りました ・0°〜180°の大きな姿勢変化でも安定し、3D再構成の劣化にも頑健に細部を保持しました ・ハイブリッドデータ学習でCLIP-Iが0.904→0.943に向上しました ・対称オブジェクトの向き付けでは、RGB幾何ガイダンスが法線マップを上回ることも示しました #3DGeneration# #ImageEditing#
もっと見る
動画生成モデルで4D世界を作るとき、わざわざRGBに戻す必要はなかった——潜在空間から直接4Dへ変換する新手法が登場しました。 Beyond Pixels: From Video Priors to 4D Worlds 🔍 概要 従来の「動画生成→RGB→4D再構成」という3段階カスケードは、RGB変換でVAE潜在空間の幾何学情報を失い、アーティファクトを増幅させる構造的な問題を抱えていました。本研究は動画VAEの最終デノイズ済み潜在を直接4Dデコーダーに接続する「latent-to-4D生成」を提案します。 🛠 解決する課題 ・RGBデコード時に幾何学情報が劣化する ・ジェネレーター固有ノイズがRGB経由で4D再構成に伝播する ・ジェネレーターが変わるたびに4Dモジュールを再学習する必要がある これらすべてを、VAE潜在空間を直接インターフェースにすることで回避します。 ⚙ 方法論と提案手法 3つのコンポーネントで構成されます。 ・アライメントモジュール(𝒜ϕ):三線形リサンプリングと3D畳み込みで潜在を4Dデコーダーのトークン空間に変換 ・L4ARアテンション:フレームワイズ空間整合 + グローバル時間アテンションの階層的組み合わせ ・4Dデコーダー:カメラパラメータ(9D)と密な世界座標系ポイントマップを同時予測 学習対象はこの3コンポーネントのみ(rank-16 LoRA含む)。VAEやTransformer本体は凍結し、約1,000クリップで学習します。 📊 実験結果 DINO-F1スコア(テキスト→4D):57.01〜57.09(本手法)対 53.27〜54.21(カスケードベースライン)。画像→4Dでは61.60対55.79で5.81ポイント改善。人間評価でも幾何学・完全性で66.8〜72.1%の好みを得ています。頑健性テストでは汚染レベルρ=0.6時のドリフトが0.0053(ベースライン比71倍の安定性)を記録しました。 🌐 汎用性 14Bと1.3Bの2サイズのWan T2VモデルおよびWan I2Vモデルで、単一チェックポイントが変更なしに動作。モーション・外観・カメラ制御もそのまま引き継がれます。 #4D生成# #動画AI#
もっと見る
Kimi K3で動画生成プロンプトからプリビズを作るツールを作ってみました✨ プロンプトをショットごとに分解し、空撮 → プッシュイン → 手持ちなどのカメラワークを簡易3Dで生成します。 中身はReact / TypeScript+Three.jsです。 プロンプトの構造化、3Dシーン生成、カメラリグ、タイムラインまで、Kimi K3に実装してもらいました。 ※一部LLMのAPIを使用しています 画面上での変更やシミュレーションもできるようにしたらもう少し使い勝手が良くなるかもしれません。 プロンプト → プリビズ → 動画生成にすることでプレビズでの事前チェックやリファレンスにそのまま使うこともできます。 ※こちらはKimiから依頼を受けてK3を使用してみました 17:12
もっと見る
「東京ゲームショウ2026」にKDDIと共同出展、次世代3Dコンテンツ生成体験を展示
◤無料オンラインセミナー開催◢ AI映像制作の最前線をnpaka氏と検証 はじめてのAutodesk Flow Studio 🔽7/15(水)開催!お申し込みはこちらから ・実写映像の人物を3Dキャラクターに置き換え ・動画からモーションを抽出 ・映像から3Dシーンを生成
もっと見る