RAG 防投毒不只看答案:文档级注意力坍缩成为新信号
导语
检索增强生成(RAG)把外部文档引入大语言模型,使回答能够依赖较新的知识和企业内部资料。但检索上下文也成为新的攻击入口:攻击者可以向语料库或检索结果中注入恶意文档,诱导模型偏离原本应有的判断。更棘手的是,这类攻击不一定会让模型显得犹豫,反而可能制造一种“错误但自信”的输出。
题为《When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse》的研究,关注的正是这一检测难题。论文认为,与其只检查模型最后说了什么,不如观察模型在生成答案时究竟依赖了哪些文档。
核心要点
- 传统不确定性信号可能被绕过。 许多检测方法使用困惑度、答案一致性等输出侧指标判断异常。但精心设计的投毒内容可以与问题和上下文高度贴合,使受污染答案拥有更低的困惑度,看起来比正常回答更“确定”。
- 攻击会改变注意力分布。 在较为正常的生成过程中,模型通常会在多个相关文档之间分配注意力。受到投毒影响后,注意力可能逐步集中到恶意文档,文档级注意力熵随之下降。论文将这种集中化现象称为“Attention Collapse”,即注意力坍缩。
- D-SCAN 监测生成过程。 研究提出的 D-SCAN(Document-level Signal Collapse Analysis)并不主要依赖最终答案,而是跟踪生成期间不同文档获得的注意力信号,并分析其变化趋势。它的目标是以较低额外成本,为 RAG 系统增加一层内部状态检测。
- 答案没变也可能被发现。 论文报告称,D-SCAN 不仅能够识别已经改变最终输出的攻击,也能检测某些暂时没有改变答案、但已经显著影响模型文档关注方式的投毒行为。
意义与影响
这项工作的价值,在于把 RAG 安全检测从“结果审查”推进到“过程审查”。答案表面上正确,并不代表检索上下文是干净的;如果恶意文档已经获得不成比例的影响力,系统仍可能在后续问题中暴露风险。文档级注意力信号因此可以作为输出过滤、来源可信度评估和人工复核的补充依据。
不过,注意力并不是天然可靠的因果解释。不同模型架构、提示模板、文档排序和实现方式,都可能影响注意力分布。D-SCAN 是否能在复杂、多轮或代理式 RAG 中保持稳定,还需要更广泛的验证。实际部署时,较稳妥的做法是将其与文档去重、来源认证、内容一致性检查和输出审计结合,而不是把注意力坍缩当作单一判决标准。
总体来看,这篇研究提示了一个重要方向:RAG 防御不仅要问“模型答对了吗”,还要问“它为什么如此确信,以及它把信任交给了哪份文档”。
评论
正在确认登录状态……
正在加载评论……