🎨 テキストから高精細な画像を生成するモデルを、完全にオープンなレシピだけでゼロから鍛え上げ、トップクラスのモデルに迫る性能を実現しました。
タイトル: LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
URL:
🖼️ 概要
LLaDA-Imageは、6BパラメータのDiffusion Transformerをゼロから訓練し、dLLMベースの視覚言語理解モジュールと組み合わせた統一的な画像生成・編集モデルです。TwinFlow蒸留により2〜4ステップという少なさで高速推論できるTurbo版もあわせて公開されています。
🧩 解決する課題
高品質な画像生成にはこれまで大量のペア画像テキストデータが必要とされ、キャプション品質のばらつきや、生成と編集を1つのモデルで両立させる難しさが課題でした。
🛠️ 方法論と提案手法
画像のみの事前学習を中心に据え、220Mサンプルのうち90%以上を画像単独データで訓練し、実画像の比率を生成訓練で98%、教師あり微調整でも70%以上に保つ「実データ優位」なレシピを採用しています。長時間の訓練を安定させるパラメータフリーRMSNormや、参照画像をセマンティック・ピクセル両経路で条件付けする編集用アーキテクチャも特徴です。
📊 ユースケース / 実験結果
Qwen-Image-Benchでは英語53.53点・中国語53.38点でオープンソース最高水準のZ-Image Turboを上回り、長文テキストレンダリングを測るCVTG-2Kでも単語精度0.875でトップの成績を収めています。一方でGenEvalの物体計数は0.53にとどまるなど、今後の改善点も明確に示されています。
#
画像生成# #
DiffusionModel#