返回文章列表
语音与音频

VibeVoice-ASR-Streaming:让语音识别实时回答“谁说了什么”

阅读约 2 分钟

导语

在多人会议、客服通话和语音代理中,仅仅把声音转换成文字并不够。系统还需要判断每句话是谁说的。传统的说话人标注语音识别通常将自动语音识别(ASR)与说话人分离或聚类作为两个环节处理,这种方案在离线场景中较为成熟,却很难同时满足实时性与低延迟要求。

微软团队发布的 VibeVoice-ASR-Streaming,试图把这个问题交给一个统一的端到端模型解决。它面向语音持续到达的场景,直接生成“谁说了什么”的结果,而不是先转写、再等待独立的说话人分析模块处理。

核心要点

  • 面向流式识别。 模型将输入组织为固定大小的音频块,并结合少量 lookahead 音频,让系统在接收新语音的同时持续更新输出。
  • 利用历史文本。 除了当前音频,模型还会参考此前生成的文本,以维持连续转写和说话人归属的一致性。
  • 统一完成两项任务。 ASR 与说话人标注不再是必须串联的独立模块,减少了额外的 diarization 阶段。
  • 提供不同规模版本。 项目开放 1.5B 和 7B 模型权重,以及相应推理代码,便于研究和应用方进行测试。
  • 评测结果具有竞争力。 报告称,7B 版本在五个评测集上取得最低平均 WER/CER;在 13 个说话人归属评测设置中,有 12 项达到最佳或并列最佳。

为什么重要

流式说话人标注识别的价值,首先体现在实时语音助手和智能代理上。系统可以在对话尚未结束时就输出带角色信息的文本,从而为实时摘要、会议记录、客服质检和多方协作提供更及时的输入。对开发者而言,统一模型也可能简化系统架构:原本需要协调识别、分段、聚类和结果对齐的多个组件,能够被更紧密地整合。

不过,这项工作并不意味着离线识别与流式识别之间的工程差异已经消失。实时系统仍需要在响应速度、前瞻音频带来的延迟、长对话上下文以及多人同时发言等因素之间做取舍。报告摘要给出了整体评测表现,但实际部署时仍应结合目标语言、噪声环境、设备算力和对话规模进行验证。

总体来看,VibeVoice-ASR-Streaming 的意义不只是把 ASR 搬到流式场景,而是尝试让模型在语音到达的过程中同步理解内容与说话人身份。随着权重和推理代码开放,它也为端到端语音代理以及流式多说话人交互研究提供了一个可复现的起点。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章