TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント
@snorbe_ai
を作っています。
@deskrex
| 著書 かんき出版『知的生産でAIを使いこなす全技法』
参加 January 2018
392
フォロー中
2.6K
ファン
Itaru Tomita / 冨田到
@itarutomy
2026.07.30 12:48
歌声とBGMをまとめて曲ごと生成できるAIモデル「WanSong v1.0」の技術レポートが公開された(https://arxiv[.]org/html/2607.14749v1)。 これまでの曲生成AIは、AR(自己回帰、文章を単語ごとに予測して繋げる方式で音を生成)か、ARと拡散モデル(ノイズから徐々に音を復元する生成方式)を組み合わせた多段階パイプラインが主流だった。WanSongはこの構成をやめ、拡散モデルだけで最大5分の高音質な楽曲を一発生成する、約250億パラメータ(25B)のモデル。しかもボーカルとBGM(伴奏)を別々の音声トラックとして同時に出力する。 このdual-stem(2軌道)構成には理由がある。ボーカルとBGMを1つのトークンにまとめて学習すると、モデルがボーカルに引っ張られてBGMの表現が弱くなる。さらに生成の忠実度を調整するCFG(Classifier-Free Guidance)を強めるとボーカルは正確になるがBGMが崩れ、弱めるとその逆が起きるというジレンマもあった。WanSongはボーカルとBGMを完全に別トークンとして学習し、この干渉自体をなくしている。副産物として生成直後から両者が別トラックのまま得られるため、後工程のミックスや編集もしやすい。 600万時間超の多言語楽曲データで学習し、中国語・英語・日本語・韓国語4言語・200曲のベンチマークでは発音誤り率(PER)が7.43%と、Suno V5の22.80%、Mureka V7.6の12.7%を大きく下回った。独自の音楽性評価でも5.49点でSuno V5の4.18点を上回っている。
もっと見る
0
0
0
0
0
コミュニティへ転送
人気のあるユーザー
New York Post
@nypost
4.1M ファン
オリコンニュース
@oricon
1.9M ファン
Reuters
@Reuters
26.3M ファン
一劍浣春秋
@chee828
0 ファン
Hello! Project Link
@UpFrontLink
15.5K ファン
モデルプレス
@modelpress
1.8M ファン
First Squawk
@FirstSquawk
556.1K ファン
Pop Base
@PopBase
6.4M ファン
MLB
@MLB
13.6M ファン
銀璃 Silverluri🪶
@Silverluri
0 ファン
JO KWON
@2AMkwon
976.9K ファン
Natsume✨枣糕
@natsume0v0
1.3M ファン
CNN
@CNN
61.8M ファン
ばつ👶
@batuACT3
117.2K ファン
Binance
@binance
16.1M ファン