TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント
@snorbe_ai
を作っています。
@deskrex
| 著書 かんき出版『知的生産でAIを使いこなす全技法』
参加 January 2018
392
フォロー中
2.6K
ファン
Itaru Tomita / 冨田到
@itarutomy
2026.07.30 12:48
歌声とBGMをまとめて曲ごと生成できるAIモデル「WanSong v1.0」の技術レポートが公開された(https://arxiv[.]org/html/2607.14749v1)。 これまでの曲生成AIは、AR(自己回帰、文章を単語ごとに予測して繋げる方式で音を生成)か、ARと拡散モデル(ノイズから徐々に音を復元する生成方式)を組み合わせた多段階パイプラインが主流だった。WanSongはこの構成をやめ、拡散モデルだけで最大5分の高音質な楽曲を一発生成する、約250億パラメータ(25B)のモデル。しかもボーカルとBGM(伴奏)を別々の音声トラックとして同時に出力する。 このdual-stem(2軌道)構成には理由がある。ボーカルとBGMを1つのトークンにまとめて学習すると、モデルがボーカルに引っ張られてBGMの表現が弱くなる。さらに生成の忠実度を調整するCFG(Classifier-Free Guidance)を強めるとボーカルは正確になるがBGMが崩れ、弱めるとその逆が起きるというジレンマもあった。WanSongはボーカルとBGMを完全に別トークンとして学習し、この干渉自体をなくしている。副産物として生成直後から両者が別トラックのまま得られるため、後工程のミックスや編集もしやすい。 600万時間超の多言語楽曲データで学習し、中国語・英語・日本語・韓国語4言語・200曲のベンチマークでは発音誤り率(PER)が7.43%と、Suno V5の22.80%、Mureka V7.6の12.7%を大きく下回った。独自の音楽性評価でも5.49点でSuno V5の4.18点を上回っている。
もっと見る
0
0
0
0
0
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
New York Post
@nypost
4.2M ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
TVer新着
@TVer_info
101K ファン
吴说区块链
@wublockchain12
181.5K ファン
Reuters
@Reuters
26.4M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K ファン
ファミ通.com
@famitsu
1.4M ファン
モデルプレス
@modelpress
2.1M ファン
First Squawk
@FirstSquawk
569.5K ファン
Bloomberg
@business
10.5M ファン
billboard
@billboard
16.8M ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
一劍浣春秋
@chee828
0 ファン
空空道人
@Kongkongda5882
34.3K ファン