YuE2、楽譜で計画してから完成曲を生成する音楽モデル
導入
音楽生成には、長く二つの方向性がありました。記号ベースのモデルは旋律、和声、リズム、曲の構成を明示できますが、完成した録音までは生成しないことが多い。一方、音声モデルは最初から最後まで聴ける曲を作れるものの、どのように作曲したのかが見えにくく、後から修正するのも容易ではありません。YuE2は、この二つを同じ生成経路に組み込もうとするモデルです。
主なポイント
- 最初にスコアを作る。 YuE2は単一のAR-NAR Mixture-of-Transformersを使い、まず旋律とコードを指定した読みやすいスコアを生成します。その後、スコアを意味的な音楽トークンへ展開し、完成した曲の音声として実現します。
- 作曲計画から音源までを統合する。 MIDIやイベント列だけを出すシステムでも、波形だけを生成するシステムでもありません。記号的な計画、音楽的な意味表現、最終的な音声生成を同じモデル内でつなぎ、ボーカルと伴奏を含む楽曲を出力します。
- 計画の効果を比較している。 同じチェックポイントを使った比較で、専門家の全体的な選好は記号的計画ありの構成が49.3%、計画なしが34.6%でした。中間スコアは編集のためだけでなく、聴感上の音楽性にも影響し得ることを示します。
- 公開ベンチマークで高い結果を報告。 WildSongBenchのSongBench Global Avgで6.73を記録し、報告内で評価された公開ベースラインを上回りました。8候補から最良の結果を選ぶbest-of-8では6.96に達します。専門家の試聴では、best-of-8がSuno v4.5より好まれ、Suno v5とはほぼ拮抗したとされています。
- 学習用の音楽理解モデルも提供する。 録音には、対応する楽譜が正確に付いていないことが多い。そこでMERT2は音楽表現学習、SheetSage2は記号的な転写を担うモデルとして導入されました。報告によれば、MERT2は15のMARBLE指標のうち14項目で従来の最高結果を更新しています。
意義と残る課題
YuE2の重要な点は、単により完成度の高い曲を出すことではありません。スコアを中間層にすることで、ユーザーは音声を書き出す前に旋律、コード、構成を確認・変更できます。プロジェクトは、ゼロショットのカバー、スコアに基づく編集、外部の言語モデルエージェントによる編集にも触れており、単発の生成器から対話的な作曲ツールへの発展を示しています。
ただし、結果は論文側が報告したベンチマークと専門家試聴に基づくもので、best-of-8は複数候補から選ぶ手順です。すべての生成が同じ品質になることを意味するわけではありません。複雑な編曲、歌詞、歌唱表現をどこまで扱えるか、また一般の利用者がスコア編集を必要とするかも今後の検証が必要です。それでも、作曲の見通しやすさと完成音源の即時性を統合する設計として、YuE2は注目すべき方向性を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…