返回文章列表
语音与音频

AuK:用统一接口打通语音生成与编辑的开源基础模型

阅读约 3 分钟

导语

语音模型正在从“把文字变成声音”走向更复杂的音频操作:用户不仅希望生成一段语音,也希望修改其中的内容、情绪、说话方式或声学环境。AuK Technical Report提出了一个开源基础模型,试图用自然语言指令和音频上下文,统一处理语音生成与编辑。

核心要点

  • 覆盖五类任务。 AuK的训练任务包括语音生成、内容编辑、增强与分离、副语言信息编辑,以及声学编辑。也就是说,模型既要理解“生成一位说话人朗读这句话”,也要处理对已有音频进行替换、增强或风格调整等指令。
  • 数据规模面向通用能力。 项目构建了约30.3亿条“指令—音频”实例,对应约195万小时的有效监督。素材摘要没有给出各任务的详细配比或数据来源,因此这些数字更适合被理解为训练规模,而不是单项能力的直接保证。
  • 语义与声学分工。 架构包含负责语义条件建模的多模态大语言模型,以及一个同时在语音、通用音频和音乐上训练的VAE,用于提取声学条件。生成部分采用混合Rectified Flow Transformer:先使用双流MMDiT模块处理不同模态,再通过统一的单流DiT模块完成生成。
  • 训练不止于预训练。 AuK先进行仅生成任务的预热,再进入生成与编辑联合预训练。之后,团队针对开放式编辑使用基于人类反馈的偏好优化,针对语音生成采用基于奖励的强化学习,分别改善指令遵循与输出偏好。
  • 推出快速版本。 为降低推理成本,AuK通过一致性初始化和任务路由的Decoupled DMD进行蒸馏。AuK-Flash支持4步推理、无需分类器自由引导;在报告给出的匹配条件下,其墙钟速度较完整模型提升4.5倍。

意义与影响

AuK的价值不只是增加一个文本转语音模型,而是把“生成”和“修改”放进同一套接口。对创作者而言,未来的音频工作流可以更接近自然语言编辑:保留原说话人的部分特征,同时调整文本、表达方式或背景声学属性。对研究者而言,五类任务的联合训练也提供了观察语义控制、说话人特征和声学细节如何协同的实验平台。

不过,统一模型并不意味着所有任务都已被同等解决。摘要没有提供完整的基准分数、语言覆盖、数据许可细节或开源权重信息,报告中的“领先”和“有竞争力”也需要结合具体评测设置理解。实际使用时,还应重点考察复杂编辑是否引入音色漂移、语义错误或音频伪影,以及快速蒸馏版本在质量上的取舍。

总体看,AuK展示了一条清晰路线:以语言作为控制入口,以音频上下文提供条件,再用扩散式生成器统一完成输出。若其开源组件和评测能够充分复现,这类模型可能推动语音合成从单次生成工具,进一步演化为可交互的音频编辑基础设施。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
GPT-Live架构拆解:实时语音系统如何兼顾低延迟与可扩展性
语音与音频
cctest.ai
语音与音频

GPT-Live架构拆解:实时语音系统如何兼顾低延迟与可扩展性

OpenAI在GPT-Live工程报告中介绍了面向连续语音交互的系统设计:将媒体与推理置于实时路径,把工具调用、任务委派和持久化等操作移至异步边界之后。该架构还通过有状态会话迁移、WebRTC优化和生产流量静默测试,解决扩展与上线验证问题。

阅读全文
CCTest · Blog
ASR“幻觉”从何而来:研究发现编码器末级是关键边界
语音与音频
cctest.ai
语音与音频

ASR“幻觉”从何而来:研究发现编码器末级是关键边界

一项研究考察了语音识别系统为何会生成与输入语音无关、却看似流畅的文本。结果显示,编码器最后阶段是语音信息完成落地、并交给解码器读取的关键位置,但绕过该阶段本身并不会直接产生自然流畅的幻觉。

阅读全文