登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 拡散モデル
拡散モデル コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
拡散モデル を含む検索結果
歌声とBGMをまとめて曲ごと生成できるAIモデル「WanSong v1.0」の技術レポートが公開された(https://arxiv[.]org/html/2607.14749v1)。 これまでの曲生成AIは、AR(自己回帰、文章を単語ごとに予測して繋げる方式で音を生成)か、ARと拡散モデル(ノイズから徐々に音を復元する生成方式)を組み合わせた多段階パイプラインが主流だった。WanSongはこの構成をやめ、拡散モデルだけで最大5分の高音質な楽曲を一発生成する、約250億パラメータ(25B)のモデル。しかもボーカルとBGM(伴奏)を別々の音声トラックとして同時に出力する。 このdual-stem(2軌道)構成には理由がある。ボーカルとBGMを1つのトークンにまとめて学習すると、モデルがボーカルに引っ張られてBGMの表現が弱くなる。さらに生成の忠実度を調整するCFG(Classifier-Free Guidance)を強めるとボーカルは正確になるがBGMが崩れ、弱めるとその逆が起きるというジレンマもあった。WanSongはボーカルとBGMを完全に別トークンとして学習し、この干渉自体をなくしている。副産物として生成直後から両者が別トラックのまま得られるため、後工程のミックスや編集もしやすい。 600万時間超の多言語楽曲データで学習し、中国語・英語・日本語・韓国語4言語・200曲のベンチマークでは発音誤り率(PER)が7.43%と、Suno V5の22.80%、Mureka V7.6の12.7%を大きく下回った。独自の音楽性評価でも5.49点でSuno V5の4.18点を上回っている。
もっと見る
動画生成AIに複数ステップで考える力を持たせる新手法HDR(Hierarchical Denoising for Visual Reasoning)が発表された(https://arxiv[.]org/html/2607.15278v1)。 いまの動画生成AIの多くは拡散モデル(ランダムなノイズを少しずつクリアな映像に近づけていく生成の仕組み)を使っていて、迷路やハノイの塔のような視覚的な推論もできるようになってきた。ただし既存の生成方式には弱点がある。ストリーミング型(過去のフレームだけを見て左から右へ逐次生成する方式、CausVidなど)は速いが、一度生成したフレームを後から直せず序盤の判断ミスを引きずる。双方向型(動画全体を毎ステップまとめてノイズ除去する方式)は前の判断を修正できて賢いが、毎回全フレームを更新するので計算コストが重くストリーミングに向かない。 HDRは動画の潜在表現(モデル内部で圧縮された動画データ)を6段階の木構造の階層に組む。粗いレベルはノイズを多めに残して複数の可能性を保持したまま大枠の計画を立て、細かいレベルに降りるほどノイズを削って具体的な映像へ絞り込む。各階層の中は左から右への逐次生成を保つのでストリーミングの速さはそのまま。SHAP(疎な階層的注意機構、各フレームが近くのフレームと一つ上の階層だけを参照して計算量を抑える仕組み)も導入している。論文では、既存方式が迷路で序盤に間違った分岐を選んで失敗するのに対し、HDRは分岐の判断を保留してから細部を詰めて正解にたどり着く例が紹介されている。 迷路・ハノイの塔・一筆書き・スライドパズル・倉庫番・水注ぎの6タスク、370本の評価動画によるベンチマークでは、ストリーミング型ベースライン(CausalForcing)比で成功率が34.22から60.29へ(76.2%の相対改善)、平均進捗スコアも76.00から89.56へ向上。推論速度は1フレームあたり0.70秒で、双方向型(37.92秒)より54.2倍速いのにストリーミング型ベースライン(0.72秒)とほぼ同速。学習データを2%に絞っても82.9%の成功率を維持できており(双方向型は52.0%まで低下)、データ効率の高さも見どころ。実機ロボットアームの迷路実験でも同じ枠組みが機能したという。
もっと見る
「1文字ずつ」しか喋れないAIは、もう古いのかもしれません🌀 画像生成で大成功した拡散モデルを、ついに言語生成へ持ち込んだ研究が登場しました。 タイトル: dLLM: Simple Diffusion Language Modeling URL: 🌀 概要 本研究は、画像生成でおなじみの「拡散モデル」の考え方を、言語モデリングに応用したフレームワーク「dLLM」を提案しています。テキストを左から右へ順番に作るのではなく、ノイズ(マスク)まみれの状態から、複数ステップをかけて文章全体を少しずつ整えていく「反復的な精緻化」によって生成します。名前のとおり、複雑な仕掛けを足さずに、できる限りシンプルに実現することを重視しているのが特徴です。 ❓ 解決する課題 現在のLLMの主流は、トークンを1つずつ予測していく「自己回帰(Autoregressive)」方式です。しかしこの方式には弱点があります。 ・逐次生成のため本質的に並列化しにくく、長文ほど生成が遅くなりがちです ・一度書いたトークンを後から推敲・修正する仕組みがなく、全体を見渡して整えるのが苦手です 拡散ベースの生成は、これらの制約を別の角度から解きほぐす可能性を持っています。 💡 方法論と提案手法 dLLMは、言語生成を「離散拡散(Discrete Diffusion)プロセス」として定式化し直します。 ・マスクされた、あるいはノイズの乗ったトークンからスタートします ・複数ステップにわたって段階的にアンマスク(デノイズ)し、クリーンな系列へ復元します ・破損した入力から正しいトークンを予測するよう、ニューラルネットワークを訓練します ・複数トークンを同時に生成できる「並列デコーディング」に対応します 新規の特殊なネットワークを設計するのではなく、既存のTransformerにそのまま載せられる点が実装上の大きな利点です。 🌍 ユースケース / 実験結果 複数のモデル規模・系統で有効性が確認されました。 ・エンコーダ系:ModernBERTを拡散方式で訓練し、分類ベンチマークで競争力ある結果を達成 ・デコーダ系:QwenやLlamaをベースにした拡散モデルでも、言語理解タスクで実用的な性能を確認 ・並列デコーディングにより、標準的な自己回帰方式より高速な推論を実現 ・0.6Bから、より大きなパラメータ領域まで一貫して有効性を確認 高速応答が求められるチャットや、推論コストを抑えたい大規模サービスでの活用が期待されます。 #拡散モデル# #LLM#
もっと見る
🔁 「じっくり考えるほど賢くなる」AIを、勾配爆発を起こさずに学習させる方法が見つかりました。 タイトル: Thinking with Looped Flows URL: 再帰的に隠れ状態を更新して「考える」ループモデルは、これまでBPTT(時間方向の逆伝播)の不安定さに悩まされてきました。Looped Flowsは拡散モデルの学習原理を借りることでこれを解決した手法です。注目ポイントを3つ紹介します。 🧠 BPTTなしで再帰計算を学習 ノイズレベルを徐々に減らしながら各ステップをローカルな損失で学習することで、勾配消失・爆発を起こさずに「考え続ける」状態を安定して学習できます。 ⏱ 推論時に計算量を後から増やせる 学習時より細かい時間刻みで推論するだけで性能が伸び、Sudokuでは8ステップの74.5%から128ステップで97.9%まで向上します。 🏆 ARC-AGIで既存手法を上回る ARC-AGI-1で58.8%、ARC-AGI-2で12.2%を達成し、いずれも従来のループモデル手法を上回りました。 推論時にじっくり計算するほど賢くなる、というテスト時スケーリングの新しい実現方法として興味深い研究です。 #LLM推論# #機械学習#
もっと見る
深層学習の歴史を振り返ると、AlexNetが「手作業で工程を分けるより、入力から出力まで丸ごと1つのモデルで学習させる(end-to-end)方が強い」ことを示したのが革命の始まりだった。ところが生成AIだけはこの流れに乗り切れていない、という指摘から始まる論文が公開された(https://arxiv[.]org/html/2607.27372v1)。 拡散モデルや自己回帰モデル(要素を1つずつ順番に予測して生成するモデル)など、今の生成AIはどれも「生成の手順を細かいステップに分解する」ことで動いている。拡散モデルなら、ノイズだらけの画像を少しずつクリアにしていく数百ステップだ。これは「1つの入力に無数の正解がありうる」多峰性(複数の正解パターンがある)分布を、各ステップではほぼ一意な予測に絞り込むための工夫だが、この分解のせいで学習時(1ステップだけ予測)と推論時(数百ステップ繰り返す)でやっていることが食い違い、end-to-end(学習と推論の手順を完全一致させる訓練方式)にはなっていなかった。 この論文の「Explorative Modeling(探索的モデリング)」は逆転の発想で、生成の手順は分解せず学習ループ自体を分解する。各学習ステップでモデルに複数の候補を生成させ、正解データに一番近いものだけを使って学習する(best-of-k方式)。候補が1個だとモデルの最善手はすべての正解の平均になりぼやけた画像しか出せないが、候補をk個に増やすとそれぞれが別々の正解パターンを担当できるようになる。論文中の犬画像の比較が分かりやすく、候補1個ではほぼ完全にぼやけた模様、候補50個まで増やすと元画像とほぼ見分けがつかない鮮明さになっている。 この「探索の量」はパラメータ数・データ量に続く第三のスケーリング軸として機能し、画像・動画・言語のすべてで性能が単調に向上する。しかも効果はスケールが大きくなるほど強く、データ量を増やした場合の改善幅は7%から36%へ、モデルサイズを増やした場合は13%から23%へ拡大した。効率面ではFLOP(計算量)効率が4.1倍、サンプル効率が6.2倍、パラメータ効率が47%改善し、最強の画像生成レシピではImageNet 256×256でガイダンスなし1.43 FID(生成画像の品質指標、小さいほど良い)というほぼ最先端の性能に到達している。動画生成では過学習も抑えられ、FVD(動画品質指標、小さいほど良い)の最良値が探索なしの37.5から探索ありで30.0まで改善した。 さらにロボット制御タスクでは単体のend-to-end生成モデルとしても機能し、拡散モデルベースの手法と同等の性能を推論ステップ数16分の1から256分の1で達成した。数百回繰り返していた予測が、たった1回の計算で済むことになる。
もっと見る
「サングラスをかけたトカゲ」を描かせたら、サングラスが消えるか顔が崩れる。画像生成AIの「制御」問題に、Googleが数学的な答えを出しました。 タイトル: How Diffusion Controller unifies and simplifies AI image generation URL: 📝 概要 画像生成を逐次ステップの集まりではなく連続的な「制御問題」として捉え直すフレームワークDiffusion Controllerです。ベースモデルは凍結したまま、軽量なサイドネットワークを追加するだけで挙動を調整します。 ❓ 解決する課題 推論時のガイダンスと重いファインチューニング(LoRA等)という2系統は、統一的な数学原理を持たないため、好みへの適合と画質のバランスを手探りで調整するしかありませんでした。 💡 方法論と提案手法 デノイジング中の中間状態を観察し、モデル内部の重みに触れずに微小な補正を注入します。ポリシー勾定(PPO)方式と報酬重み付き損失方式の2つの実装で、画質を守るガードレールを備えています。この構造により、非公開のクローズドソースモデルすら制御可能になります。 📊 実験結果 Stable Diffusion v1.4でLoRAより少ない層しか操作しないにもかかわらず、SFT・RWL両方の学習経路でLoRAを上回りました。完全にアンロックした版ではベースライン比90%の勝率を記録し、複雑なプロンプトでの人間評価でも最良の品質を示しています。 #画像生成AI# #拡散モデル#
もっと見る
【拡散希望】 冬コミ前日12/29(月)秋葉原 コスプレ作品頒布即売会&撮影会「コスROMコミケ前日祭3(#ろむぜん3#)」開催! 秋葉原駅から徒歩圏内会場で、豪華モデル16名が集結✨ 予約不要につきふらっとお越し頂いてOK! 2025年ラスト皆様のご参加をお待ちしてます。 詳細▼
もっと見る
【拡散希望】今年開催の個展にむけて、ポラロイドカメラを使ったヌード(セミOK)作品のモデルをプロアマ問わず数名募集します。初回の撮影は、4/24の14~18時、原宿近辺で行います。初回に限らずご興味ある方は簡単な自己PRとプロフ写真を添付のうえ、DMにてご応募ください。薄謝あり。
もっと見る
【拡散希望】神戸市会教育こども委員会委員長に就任し2ヶ月。私の政策に進展がありました!学校でのいじめ(校内犯罪)対策として抑止力や被害児童生徒が泣き寝入りしないよう証拠確保の為に監視カメラ設置を主張していましたが、神戸市教育委員会は試験的にモデル校を選定し実施する方向となりました!
もっと見る