登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ImageEditing
ImageEditing コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ImageEditing を含む検索結果
🖼 画像編集のテスト時スケーリングは「どんな編集にも同じ計算予算」を割り当てがちで、無駄だらけでした。難易度に応じて配分し、編集に特化した検証で枝刈りすることで、品質を保ったまま最大2.2倍の高速化を実現した研究です。 タイトル: From Scale to Speed: Adaptive Test-Time Scaling for Image Editing URL: 📝 概要 ADE-CoTは、目的志向の画像編集に特化したテスト時スケーリング手法です。テキストから画像を作る生成向けに作られた従来のImage-CoTをそのまま編集に流用するのではなく、「難易度に応じた資源配分」「編集特化の早期検証」「機会主義的な停止」という3つの戦略を組み合わせ、計算を大きく節約しながら品質を維持します。 ❓ 解決する課題 従来手法には3つのミスマッチがありました。 ・固定のサンプリング予算が、ほとんど改善しない簡単な編集にも計算を浪費する ・汎用のMLLMスコアが、早期スコアは低くても最終的に高得点になるサンプルの約40%を誤って枝刈りしてしまう ・大規模サンプリングが同一の正解を何度も生み、不要な計算を増やす 💡 方法論と提案手法 ・編集の難易度を見て、簡単な編集は最小予算、複雑な編集は探索を拡大します ・ワンステップ・プレビューで、追加のデノイジングなしにノイズ中間状態からクリーンな潜在を推定し、早期検証を信頼できるものにします ・Grounded SAM2で「意図した領域だけが変わったか」を検証し、DINOv2の埋め込みで冗長な候補を除去します ・候補を逐次生成し、意図に合う結果が十分に得られた時点で打ち切る深さ優先の停止を使います 🎯 ユースケース 複雑な姿勢変更、複数オブジェクトの削除や置換、細粒度の領域編集、マルチターンの逐次編集、そして計算制約下での高品質編集に向きます。本番の画像編集APIのように推論コストが効く場面で特に有効です。 📊 実験結果 ・GEdit-Benchで、FLUX.1 KontextがBest-of-N比2.2倍、BAGELが1.8倍、Step1X-Editが2.0倍の高速化を達成しました ・推論効率は固定32サンプル予算で2倍超、結果効率は3つのベンチで4.9倍・2.7倍・2.9倍に向上しました ・「白い服の女性の隣に立つ人を消す」といった難しい複数オブジェクト編集でも、ベースラインの誤認を正しく解決しました #ImageEditing# #DiffusionModels#
もっと見る
🪑 画像に物を「3Dの向きと位置まで指定して」自然に挿入。テキストでは曖昧、パラメータでは難しかった3D姿勢制御を、視覚プロキシの分解で解いた手法DIRECTです。 タイトル: Direct 3D-Aware Object Insertion via Decomposed Visual Proxies URL: 📝 概要 DIRECTは、参照オブジェクトを画像へ挿入する際に、3Dの姿勢と位置を明示的に制御できる拡散ベースの手法です。挿入条件を幾何・外観・文脈の3つに分解し、独立した経路で注入します。 ❓ 解決する課題 既存の挿入手法は2Dインペインティングとして定式化され、3D姿勢を制御できませんでした。テキスト誘導は空間的に曖昧、パラメトリックな3D手法は抽象パラメータを正しい幾何投影へ翻訳できない、という限界がありました。 💡 方法論と提案手法 ・ユーザーが操作する3Dプロキシを目標姿勢でレンダリングし幾何ガイダンスを得ます ・外観(参照の高忠実度な見た目)と文脈(背景の意味)を、別々のLoRAと位置埋め込みで独立注入し特徴のもつれを防ぎます ・TRELLISで画像から粗い3Dを生成し、VGGTと3D Gaussian Splattingで姿勢を精緻化します ・FLUX.1-Fill上に構築し、形状分解マスク拡張と漸進的解像度学習で過学習を防ぎます 🎯 ユースケース バーチャルステージング、EC商品撮影、精密な空間制御が要るクリエイティブ制作、フォトリアルなAR/VRコンテンツ生成などに使えます。 📊 実験結果 ・FLUXベースでPSNR 23.09、LPIPS 0.147、マッチング誤差17.8と、ベースラインを全指標で上回りました ・0°〜180°の大きな姿勢変化でも安定し、3D再構成の劣化にも頑健に細部を保持しました ・ハイブリッドデータ学習でCLIP-Iが0.904→0.943に向上しました ・対称オブジェクトの向き付けでは、RGB幾何ガイダンスが法線マップを上回ることも示しました #3DGeneration# #ImageEditing#
もっと見る