Qwen-Music 技术报告:用“旋律思维链”生成完整人声歌曲
导语
Qwen 团队在 Hugging Face Daily Papers 上提交了《Qwen-Music Technical Report》,介绍了一套面向完整歌曲生成的音乐模型。与只生成伴奏或短音频片段的系统不同,Qwen-Music 的目标是产出包含完整人声演唱、结构更连贯、音质更高的歌曲,并覆盖文本生歌与翻唱生成两类任务。
核心要点
- 两类生成任务:其一是 Text to Music Generation,用户可用文字描述、歌词和音乐属性生成全新歌曲;其二是 Cover Song Generation,即在保留参考歌曲旋律关系的同时,改变风格、人声特征或演绎方式。
- 三段式架构:Qwen-Music-Tokenizer 负责把音频压缩成 25 Hz、单码本的 Music Semantic Tokens,用较紧凑的形式保留语义与旋律信息;Qwen-Music-LLM 在这些 token 上做自回归音乐语义建模;Qwen-Music-Render 则把离散语义结果渲染为更丰富的高保真立体声波形。
- Melody-CoT 机制:报告中最值得注意的创新是基于旋律 token 的“旋律思维链”。模型不是直接从头到尾生成整首歌,而是先进行旋律规划,再扩展为完整歌曲。这一设计被用于提升创造性、音乐性、结构一致性,也有助于基于参考音频进行旋律克隆。
- 大规模多语种训练:Qwen-Music-LLM 使用超过 500 万小时、覆盖数百种语言的音乐数据训练。训练流程包括质量感知的预训练课程,以及由监督初始化、离线 DPO 和在线 GSPO 组成的渐进式后训练,用于增强音乐性与指令跟随能力。
意义与影响
音乐生成模型的难点不只在“听起来像音乐”,还在于旋律、歌词、人声、编曲和整体结构能否长时间保持一致。Qwen-Music 的路线体现了一个趋势:先把音乐抽象为适合语言模型预测的语义 token,再用专门的渲染模块恢复声学细节。这让大语言模型式的规划能力与音频生成的质感需求形成分工。
报告称,在 600 个中英文提示词测试中,Qwen-Music 在 16 项客观音乐性与音频质量指标中的 13 项达到最优;专业评估者也更偏好它相较于领先专有系统的输出。对于翻唱任务,报告还表示它比领先专有系统更准确地保留参考旋律。
不过,素材中并未给出模型权重开放计划,讨论区用户也在询问是否开源。因此,现阶段更适合把它视为一次技术路线展示:如果后续开放模型、接口或更多可复现实验,Qwen-Music 可能会进一步推动 AI 音乐从片段生成走向可控、可演唱、可改编的完整歌曲生产。
评论
正在确认登录状态……
正在加载评论……