「サングラスをかけたトカゲ」を描かせたら、サングラスが消えるか顔が崩れる。画像生成AIの「制御」問題に、Googleが数学的な答えを出しました。
タイトル: How Diffusion Controller unifies and simplifies AI image generation
URL:
📝 概要
画像生成を逐次ステップの集まりではなく連続的な「制御問題」として捉え直すフレームワークDiffusion Controllerです。ベースモデルは凍結したまま、軽量なサイドネットワークを追加するだけで挙動を調整します。
❓ 解決する課題
推論時のガイダンスと重いファインチューニング(LoRA等)という2系統は、統一的な数学原理を持たないため、好みへの適合と画質のバランスを手探りで調整するしかありませんでした。
💡 方法論と提案手法
デノイジング中の中間状態を観察し、モデル内部の重みに触れずに微小な補正を注入します。ポリシー勾定(PPO)方式と報酬重み付き損失方式の2つの実装で、画質を守るガードレールを備えています。この構造により、非公開のクローズドソースモデルすら制御可能になります。
📊 実験結果
Stable Diffusion v1.4でLoRAより少ない層しか操作しないにもかかわらず、SFT・RWL両方の学習経路でLoRAを上回りました。完全にアンロックした版ではベースライン比90%の勝率を記録し、複雑なプロンプトでの人間評価でも最良の品質を示しています。
#
画像生成AI# #
拡散モデル#