YuE2:让音乐模型先写乐谱,再生成完整歌曲
导语
音乐生成模型长期存在一条明显分界:符号模型擅长表达旋律、和声、节奏与曲式,却往往停留在乐谱或事件序列;音频模型能够直接产出一首听起来完整的歌曲,但创作过程中的结构和意图通常难以观察、修改。YuE2试图把两条路径接起来,让模型先“想清楚怎么写”,再“把它唱出来”。
核心要点
- 符号规划位于生成流程前端。 YuE2使用单一的AR-NAR Mixture-of-Transformers,先生成描述旋律与和弦的可读乐谱,再将其扩展为语义音乐令牌,最终合成为完整歌曲音频。
- 从结构到成品形成统一链路。 与只输出MIDI或只生成波形的系统不同,YuE2试图在同一模型内连接作曲规划、语义表示和音频实现,输出包含人声与伴奏的歌曲。
- 评测支持规划机制的价值。 在使用同一检查点的对比中,报告称专家对带符号规划版本的整体偏好为49.3%,无规划版本为34.6%。这意味着可解释的中间表示不只是方便编辑,也可能改善最终听感。
- 公开基准表现突出。 在WildSongBench上,YuE2的SongBench Global Avg得分为6.73,高于报告中评估的公开基线;从八个候选结果中择优时,平均分达到6.96。作者还报告称,最佳候选结果在专家比较中优于Suno v4.5,与Suno v5的偏好接近均衡。
- 补齐训练所需的音乐理解能力。 由于大规模录音通常没有与之严格对齐的乐谱,项目同时介绍MERT2和SheetSage2,为语义音乐表示与符号转录提供监督。报告称,MERT2在15项MARBLE指标中的14项超过此前最佳结果,SheetSage2也在多个基准组合中领先。
意义与局限
YuE2的关键价值不只是“生成更像歌曲”,而是把音乐生成改造成一个可检查的分阶段过程。乐谱作为中间层,理论上可以支持旋律、和弦和结构的编辑,也为外部语言模型代理参与修改提供了接口。报告还提到,系统支持零样本翻唱和基于乐谱的编辑,这使它更接近创作工具,而非一次性音频采样器。
不过,现有结果主要来自论文作者提供的基准与专家听测,且最佳候选策略依赖从多个结果中挑选,不能简单等同于每次生成都稳定达到最高质量。符号规划能否覆盖复杂编曲、歌词与演唱表达,以及用户是否愿意在乐谱层面工作,仍需更多公开测试。总体看,YuE2代表了一种值得关注的方向:让生成式音乐系统同时具备作曲的可解释性和音频成品的即时性。
评论
正在确认登录状态……
正在加载评论……