让模型先判断“能不能答”:RAG可靠性的新路由器
导语
RAG常被描述为“先检索、再生成”:系统把外部文档交给语言模型,由模型据此组织答案。但在真实应用中,检索结果并不总是可靠。文档可能缺少回答问题所需的关键事实,也可能包含彼此矛盾的陈述。若模型在这两种情况下仍然流畅作答,RAG反而会把“不确定性”包装成确定答案。
论文《Knowing Before Answering: Decoding Language Models for Reliable RAG》关注的正是回答之前的判断环节:模型能否识别当前证据是否足够,并在必要时选择暂停回答、请求更多检索,或转入冲突处理流程。
核心要点
- 把RAG前置判断转化为三分类。 研究不只区分“可回答”和“不可回答”,而是将输入划分为信息充分、信息不足和信息冲突三类。这样的划分更贴近检索系统的实际故障模式:缺证据与证据打架,需要不同的后续策略。
- 使用受控数据隔离判断能力。 团队构建了模拟RAG流程的基准数据集,并使用虚构信息标注样本。这样可以减少现实世界知识、网页噪声和事实记忆对实验的干扰,集中考察模型如何处理问题与所给文档之间的关系。
- 读取模型内部特征,而不只依赖提示词。 研究从语言模型中提取隐藏激活、注意力相关特征以及MLP特征输出,再训练轻量级线性模型作为路由器。它不需要重新训练整个语言模型,而是利用模型在处理输入时已经产生的内部表征。
- 跨模型测试显示内部信号具有稳定价值。 实验覆盖16个不同架构和规模的语言模型。总体上,特征路由器持续优于基于提示词的基线,也优于研究中比较的专门RAG模型。
- 中间层尤其值得关注。 分析显示,最有信息量的信号通常出现在模型中间层;在多数测试模型中,隐藏激活比注意力值或MLP特征输出更有效。这表明“证据是否足够”的判断可能并非只存在于最终输出层,而是在模型形成语义关系的过程中逐步显现。
意义与影响
这项工作提供了一种不同于“让模型自己说它是否确定”的可靠性方案。直接提示模型回答“我能不能回答”容易受到措辞、格式和生成倾向影响;而从内部激活中训练一个专门的判断器,可以把回答资格评估从生成任务中分离出来。在线系统因此可以先由路由器检查证据状态,再决定是生成答案、追加检索,还是向用户披露冲突。
不过,论文摘要所描述的验证主要建立在受控的虚构信息数据集上。现实RAG还会面对检索排序偏差、文档质量差异、长上下文干扰以及领域迁移等问题,因此内部信号能否在开放域和生产环境中保持稳定,仍需进一步验证。特征路由器本身也需要在不同模型、任务和数据分布上校准,不能简单视为通用的“幻觉探测器”。
更值得注意的是,这项研究把RAG可靠性从输出端检测推进到推理过程中的状态识别:模型可能已经在内部表示中区分了“证据足够”“证据缺失”和“证据冲突”。如果这一能力能够被低成本解码,未来的RAG系统或许不必一味追求更长上下文,而可以先学会在不该回答时停下来。
来源:arXiv
评论
正在确认登录状态……
正在加载评论……