返回文章列表
语音与音频

Qwen-Music 技术报告:用“旋律思维链”生成完整人声歌曲

阅读约 2 分钟

导语

Qwen 团队在 Hugging Face Daily Papers 上提交了《Qwen-Music Technical Report》,介绍了一套面向完整歌曲生成的音乐模型。与只生成伴奏或短音频片段的系统不同,Qwen-Music 的目标是产出包含完整人声演唱、结构更连贯、音质更高的歌曲,并覆盖文本生歌与翻唱生成两类任务。

核心要点

  • 两类生成任务:其一是 Text to Music Generation,用户可用文字描述、歌词和音乐属性生成全新歌曲;其二是 Cover Song Generation,即在保留参考歌曲旋律关系的同时,改变风格、人声特征或演绎方式。
  • 三段式架构:Qwen-Music-Tokenizer 负责把音频压缩成 25 Hz、单码本的 Music Semantic Tokens,用较紧凑的形式保留语义与旋律信息;Qwen-Music-LLM 在这些 token 上做自回归音乐语义建模;Qwen-Music-Render 则把离散语义结果渲染为更丰富的高保真立体声波形。
  • Melody-CoT 机制:报告中最值得注意的创新是基于旋律 token 的“旋律思维链”。模型不是直接从头到尾生成整首歌,而是先进行旋律规划,再扩展为完整歌曲。这一设计被用于提升创造性、音乐性、结构一致性,也有助于基于参考音频进行旋律克隆。
  • 大规模多语种训练:Qwen-Music-LLM 使用超过 500 万小时、覆盖数百种语言的音乐数据训练。训练流程包括质量感知的预训练课程,以及由监督初始化、离线 DPO 和在线 GSPO 组成的渐进式后训练,用于增强音乐性与指令跟随能力。

意义与影响

音乐生成模型的难点不只在“听起来像音乐”,还在于旋律、歌词、人声、编曲和整体结构能否长时间保持一致。Qwen-Music 的路线体现了一个趋势:先把音乐抽象为适合语言模型预测的语义 token,再用专门的渲染模块恢复声学细节。这让大语言模型式的规划能力与音频生成的质感需求形成分工。

报告称,在 600 个中英文提示词测试中,Qwen-Music 在 16 项客观音乐性与音频质量指标中的 13 项达到最优;专业评估者也更偏好它相较于领先专有系统的输出。对于翻唱任务,报告还表示它比领先专有系统更准确地保留参考旋律。

不过,素材中并未给出模型权重开放计划,讨论区用户也在询问是否开源。因此,现阶段更适合把它视为一次技术路线展示:如果后续开放模型、接口或更多可复现实验,Qwen-Music 可能会进一步推动 AI 音乐从片段生成走向可控、可演唱、可改编的完整歌曲生产。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
黑客泄露文件揭开 Suno 训练数据来源:音乐 AI 的“合理使用”边界再受拷问
语音与音频
cctest.ai
语音与音频

黑客泄露文件揭开 Suno 训练数据来源:音乐 AI 的“合理使用”边界再受拷问

据 404 Media 报道,黑客取得的 Suno 文件显示,这家 AI 音乐生成公司曾从 YouTube Music、Deezer、Genius 等平台抓取大量音频和歌词。事件让 Suno 训练数据来源、版权抗辩和用户数据安全问题同时暴露在聚光灯下。

阅读全文