返回文章列表
语音与音频

YuE2:让音乐模型先写乐谱,再生成完整歌曲

阅读约 3 分钟

导语

音乐生成模型长期存在一条明显分界:符号模型擅长表达旋律、和声、节奏与曲式,却往往停留在乐谱或事件序列;音频模型能够直接产出一首听起来完整的歌曲,但创作过程中的结构和意图通常难以观察、修改。YuE2试图把两条路径接起来,让模型先“想清楚怎么写”,再“把它唱出来”。

核心要点

  • 符号规划位于生成流程前端。 YuE2使用单一的AR-NAR Mixture-of-Transformers,先生成描述旋律与和弦的可读乐谱,再将其扩展为语义音乐令牌,最终合成为完整歌曲音频。
  • 从结构到成品形成统一链路。 与只输出MIDI或只生成波形的系统不同,YuE2试图在同一模型内连接作曲规划、语义表示和音频实现,输出包含人声与伴奏的歌曲。
  • 评测支持规划机制的价值。 在使用同一检查点的对比中,报告称专家对带符号规划版本的整体偏好为49.3%,无规划版本为34.6%。这意味着可解释的中间表示不只是方便编辑,也可能改善最终听感。
  • 公开基准表现突出。 在WildSongBench上,YuE2的SongBench Global Avg得分为6.73,高于报告中评估的公开基线;从八个候选结果中择优时,平均分达到6.96。作者还报告称,最佳候选结果在专家比较中优于Suno v4.5,与Suno v5的偏好接近均衡。
  • 补齐训练所需的音乐理解能力。 由于大规模录音通常没有与之严格对齐的乐谱,项目同时介绍MERT2和SheetSage2,为语义音乐表示与符号转录提供监督。报告称,MERT2在15项MARBLE指标中的14项超过此前最佳结果,SheetSage2也在多个基准组合中领先。

意义与局限

YuE2的关键价值不只是“生成更像歌曲”,而是把音乐生成改造成一个可检查的分阶段过程。乐谱作为中间层,理论上可以支持旋律、和弦和结构的编辑,也为外部语言模型代理参与修改提供了接口。报告还提到,系统支持零样本翻唱和基于乐谱的编辑,这使它更接近创作工具,而非一次性音频采样器。

不过,现有结果主要来自论文作者提供的基准与专家听测,且最佳候选策略依赖从多个结果中挑选,不能简单等同于每次生成都稳定达到最高质量。符号规划能否覆盖复杂编曲、歌词与演唱表达,以及用户是否愿意在乐谱层面工作,仍需更多公开测试。总体看,YuE2代表了一种值得关注的方向:让生成式音乐系统同时具备作曲的可解释性和音频成品的即时性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Gemini 3.8 Live 发布:实时语音对话开始进入“边聊边做”阶段
语音与音频
cctest.ai
语音与音频

Gemini 3.8 Live 发布:实时语音对话开始进入“边聊边做”阶段

Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,重点提升实时语音交互、视觉理解、并行推理与后台工具调用能力。两款模型面向不同复杂度的语音代理任务,并已通过 API、Workspace、Search 和 Gemini 应用逐步开放。

阅读全文