检索更强,鲁棒性反而更差:多跳 RAG 如何放大 ASR 错误
导语
语音问答系统通常被拆成两个阶段:先用自动语音识别(ASR)把声音转换为文字,再将文字交给检索增强生成(RAG)。这意味着,检索模块拿到的并不是用户原本说出的查询,而是一份可能已经包含拼写、发音或实体识别错误的转写结果。一个自然的问题是:更复杂的多跳检索机制,能否修复这些错误?
论文《Better Retrieval, Worse Robustness》给出的答案并不乐观:结构增强可能带来更高的正常表现,却同时让系统对上游错误更加敏感。
核心要点
- 研究考察了两类多跳 RAG 扩展:基于实体图的链接,以及通过多轮推理进行的查询改写。
- 实验覆盖 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳问答基准,并使用神经 TTS 合成四种英语口音,再经过 ASR 生成测试输入。
- 四种 RAG 配置均与干净文本查询这一“理想输入”进行对照。结构更丰富的方法在 ASR 输入下通常保有更高的绝对 F1,但从干净文本到高词错误率口音的性能落差更明显。
- 在三项基准上,实体图链接与迭代改写结合时,其 F1 落差相比朴素稠密检索扩大了 36%—67%。
- 在 2WikiMultiHopQA 的退化案例中,87%—96% 都涉及至少一个查询实体被识别错误,说明实体污染是最主要的失败来源。
- N-best 解码和基于表面形式的音标实体纠错并未消除大部分差距,问题因此不只在转写结果本身,也在于下游结构如何处理残留错误。
为什么“更强”会变得更脆弱
多跳 RAG 往往需要先识别问题中的人名、地点、机构或作品,再沿着实体关系寻找下一跳证据。一旦关键实体被 ASR 改写成相似但错误的形式,实体图链接可能把查询导向错误节点;迭代式改写则可能在后续步骤中持续使用这个错误前提。相比之下,朴素稠密检索虽然能力较弱,但处理链条更短,错误被结构化放大的机会也更少。
这并不意味着图增强或迭代推理没有价值。研究结果更准确的含义是:在文本输入干净时有效的检索结构,不会自动继承到语音场景。系统需要在进入图链接和多轮检索前,对实体置信度、候选名称和原始音频进行额外校验,而不能只依赖下游模块“自行纠错”。
意义与影响
这项工作提醒开发者,语音 RAG 的评估不能只报告 ASR 条件下的最终得分,也应同时比较干净文本基线与不同口音、不同错误类型造成的性能落差。研究者发布了覆盖三个基准、四种英语口音的转写数据集,共包含 3000 个问题、12000 条记录,可用于进一步分析实体级错误传播。
对实际系统而言,关键指标或许不只是“能否检索到答案”,还包括系统是否能察觉自己正在围绕一个不可靠实体展开推理。只有把 ASR 不确定性传递给检索和生成模块,多跳 RAG 的结构优势才更可能转化为语音场景中的真实收益。
评论
正在确认登录状态……
正在加载评论……