返回文章列表
语音与音频

ASR“幻觉”从何而来:研究发现编码器末级是关键边界

阅读约 3 分钟

导语

语音识别系统的错误并不总是简单的“听错”。在某些情况下,系统会生成语法通顺、甚至颇具连贯性的文字,但这些内容并没有得到输入语音的支持。这类现象通常被称为 ASR 幻觉。它的危险之处在于,文本越流畅,用户越容易误以为系统确实听到了相应内容。

一项发表于 arXiv 的研究没有直接追问某个具体幻觉句子是怎样产生的,而是换了一个更基础的问题:语音信息在识别网络的哪一个位置开始失去约束,系统又需要经过哪些阶段才能形成真正“落地”的文本表示?

核心要点

  • 实验覆盖两种识别架构。 研究人员考察了两个独立训练的 Conformer-Large 模型,一个采用 CTC 解码,另一个采用 RNN-T 解码,并在环境退化以及说话人与背景发生变化的条件下测试它们。
  • 编码器末级呈现出关键边界。 当研究者绕过最后一个编码器模块时,几乎每条语句都会出现明显偏离;相比之下,绕过中间模块通常影响有限。这说明网络不同深度的功能并不均匀,末级可能承担着将抽象声学信息整理成可识别文本线索的重要任务。
  • 末级表示更紧凑且更接近文字。 在这一阶段,表示会变得更加紧凑,经过训练的解码器已经能够读取其中的文本信息,同时字素相关信息也变得清晰可见。
  • 破坏末级不会自动制造流畅幻觉。 实验干预后产生的主要是乱码、重复或其他失真输出,而不是自然语言般流畅、却完全脱离语音的内容。

这项研究意味着什么

论文最重要的谨慎之处,是没有把“末级失效”直接等同于“幻觉来源”。研究更准确地指出:如果编码器无法在末端形成充分受语音约束的输出,系统就具备了偏离真实输入的机制前提;但要进一步变成流畅的虚构文本,可能还需要解码器偏置、语言先验、输入质量以及推理过程中的其他因素共同作用。

这一结论对模型诊断具有实际价值。过去,人们往往把 ASR 幻觉视为整体系统在噪声或分布变化下的异常表现。该研究则提供了一个更具体的观察窗口:可以沿编码器的不同阶段检查表示是否仍然携带可验证的语音信息,并重点监测最后阶段的稳定性。对于 CTC 和 RNN-T 两类解码器都观察到类似的末级依赖,也说明这一现象可能并非某一种解码机制独有。

不过,研究并未证明只要修复最后一个编码器模块就能消除真实场景中的所有幻觉,也没有给出幻觉文本的完整生成链条。更合理的理解是,末级编码器是“可靠识别”中的一道关键闸门:它失效后,语音对输出的约束会明显减弱;而如何从这种失去约束的状态进一步演化为流畅幻觉,仍需要更深入的机制研究。

来源:arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章