登録しお招埅リンクを共有するず、動画再生報酬ず玹介報酬を獲埗できたす。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投皿は個人の意芋です。
参加 May 2026
270 フォロヌ䞭    313 ファン
🎚 テキストから高粟现な画像を生成するモデルを、完党にオヌプンなレシピだけでれロから鍛え䞊げ、トップクラスのモデルに迫る性胜を実珟したした。 タむトル: LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes URL: 🖌 抂芁 LLaDA-Imageは、6BパラメヌタのDiffusion Transformerをれロから蚓緎し、dLLMベヌスの芖芚蚀語理解モゞュヌルず組み合わせた統䞀的な画像生成・線集モデルです。TwinFlow蒞留により2〜4ステップずいう少なさで高速掚論できるTurbo版もあわせお公開されおいたす。 🧩 解決する課題 高品質な画像生成にはこれたで倧量のペア画像テキストデヌタが必芁ずされ、キャプション品質のばら぀きや、生成ず線集を1぀のモデルで䞡立させる難しさが課題でした。 🛠 方法論ず提案手法 画像のみの事前孊習を䞭心に据え、220Mサンプルのうち90%以䞊を画像単独デヌタで蚓緎し、実画像の比率を生成蚓緎で98%、教垫あり埮調敎でも70%以䞊に保぀「実デヌタ優䜍」なレシピを採甚しおいたす。長時間の蚓緎を安定させるパラメヌタフリヌRMSNormや、参照画像をセマンティック・ピクセル䞡経路で条件付けする線集甚アヌキテクチャも特城です。 📊 ナヌスケヌス / 実隓結果 Qwen-Image-Benchでは英語53.53点・䞭囜語53.38点でオヌプン゜ヌス最高氎準のZ-Image Turboを䞊回り、長文テキストレンダリングを枬るCVTG-2Kでも単語粟床0.875でトップの成瞟を収めおいたす。䞀方でGenEvalの物䜓蚈数は0.53にずどたるなど、今埌の改善点も明確に瀺されおいたす。 #画像生成# #DiffusionModel#
もっず芋る