阿里发布 CosyVoice Studio:AI 语音从转写走向一站式生产力
阅读约 2 分钟
导语
阿里巴巴正式推出一站式 AI 语音生产力平台 CosyVoice Studio,将语音识别、语音合成、音频内容生成和实时语音智能体放在同一产品体系中。相比传统“录音转文字”或“文字转语音”工具,这个平台更强调语义理解:用户说出的内容不仅被记录下来,还会被整理、改写、结构化,并进一步进入创作或业务对话流程。
核心要点
- 底层模型来自 Qwen-Audio:据原文介绍,CosyVoice Studio 基于阿里自研语音模型 Qwen-Audio 构建,并在 Artificial Analysis 的语音识别、实时交互和语音合成赛道取得靠前成绩。
- 语音键盘不止转写:CosyVoice 可将口语表达转换为更清晰的文本,自动去除“嗯”“那个”等填充词,也能处理说话中的改口与自我修正,保留最终意图。
- 面向工作场景生成结构化文本:用户口述内容后,可生成邮件、工作汇报、会议纪要等格式;数字、比例等内容也能转成更适合阅读和使用的形式。
- 长音频记录与整理:随记模式面向会议、访谈、课堂等场景,可实时转写、区分发言人,并在录音结束后生成章节化内容。已有录音也可上传处理,单次最长支持 6 小时。
- 语音智能体与音频创作:CosyAgent 面向客服、电话营销等企业场景,可通过自然语言创建具备企业知识和工具调用能力的实时语音智能体;CosyCreative 则支持播客、有声书等音频内容生成,并提供多种音色和声音复刻能力。
意义与影响
这次发布反映出 AI 语音产品的重心正在变化。过去,语音技术更多被拆成 ASR、TTS、降噪、翻译等独立模块;现在,平台化产品开始把“听、理解、组织、表达、对话”串成完整链路。对个人用户来说,语音输入有机会从便捷工具变成写作、记录和整理助手;对企业而言,语音智能体则可能成为客服、销售、培训等场景的新入口。
不过,平台能否真正落地,还取决于复杂环境下的识别稳定性、企业知识接入质量、声音复刻的合规边界,以及实时交互中的延迟与可控性。CosyVoice Studio 的价值不只在于单项模型能力,而在于阿里是否能把这些能力包装成足够易用、可靠、可集成的产品。
来源:量子位
评论
正在确认登录状态……
正在加载评论……