返回文章列表
语音与音频

把“逐字稿风格”变成可控开关:新研究改进 ASR 逐字转写与词级时间戳

阅读约 3 分钟

导语

自动语音识别(ASR)看似只是在回答“说了什么”,但在真实业务中,更难的问题常常是“应该按哪种方式记录”。同一句话可以被写成带有停顿、重复和口误的逐字稿,也可以被整理成更顺畅的意图稿。nyra labs 这篇论文把这种差异称为“转写策略”,并指出现代 ASR 模型往往在混杂标注数据上训练,把它当成不可控的潜在变量,从而影响识别稳定性、WER 评估和词级时间戳。

核心要点

  • 问题不只是识别错字:论文认为,许多 ASR 误差来自标注风格不一致。例如逐字稿会保留“嗯”“重复”“改口”,而意图稿会将它们清理掉。如果模型不知道当前要输出哪种风格,解码结果就会摇摆。
  • WER 可能被风格差异污染:摘要中提到,最高可有 60% 的报告 WER 与转写风格不匹配有关。这意味着某些评测并不完全是在衡量声学或语言建模能力,而是在惩罚模型没有猜中标注规范。
  • 模型已经“会”两种风格,关键是激活:作者的核心判断是,现代模型内部已经编码了逐字和意图两类输出方式,难点在于如何让用户或系统稳定调用目标风格。
  • 用任务 token 控制转写策略:研究使用基于平行逐字/意图转写对训练的 coverage-aware decoder task tokens,让解码器明确知道要生成哪类文本。在仅用英语训练的情况下,德语不流畅检测 F1 从 10% 提升到 79%,显示出一定跨语言迁移能力。
  • 改善词级时间戳:论文还引入监督式 cross-attention 微调,用于提升不流畅语音上的词级时间戳质量,并称效果超过强制对齐基线。
  • 提出 verbatimize 任务:作者进一步提出一种将语音语料扩展、丰富为高质量规范逐字稿的新任务,希望降低构建逐字标注数据的成本。

意义与影响

这项工作对转写、字幕、会议纪要、医疗记录、语音数据标注和 TTS 数据管线都有现实意义。很多系统过去把“清理后的文本”当成默认目标,但在合规、质检、训练语料构建或口语研究中,逐字稿往往更重要。若 ASR 能在逐字和意图模式之间稳定切换,产品就可以同时服务不同场景:一边生成可读性更强的摘要或纪要,另一边保留用于审计和数据训练的原始口语细节。

更重要的是,论文提醒行业重新审视 ASR 评测。若测试集本身混合了不同转写规范,单一 WER 指标可能会低估模型能力或误导模型选择。将转写策略显式化,可能成为未来语音模型训练、数据集发布和评测报告中的重要规范。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
GigaChat Audio:把“时间”写进长音频理解的开源大模型
语音与音频
cctest.ai
语音与音频

GigaChat Audio:把“时间”写进长音频理解的开源大模型

这篇工作聚焦长录音中的时间定位问题,提出一种面向音频的时间感知 LLM,能够在最长 120 分钟的输入中给出带明确时间戳的回答,并支持片段描述与摘要生成。 它的核心思路,是把周期性的时间标记与连续音频 token 交错输入,再借助大规模合成监督训练。

阅读全文