把幻觉看成一段话:多信号融合改进Token级检测
导语
大语言模型的幻觉并不总是以一个明显错误的词出现。一个错误事实可能横跨多个Token,前后文中的确定性、语义关系和语言模型概率也会共同暴露问题。针对传统方法逐Token、单信号判断容易漏检的缺陷,这篇论文提出了一种面向时间片段的检测框架。
核心方法:让上下文参与判断
研究把幻觉检测视为序列标注任务。系统为生成文本中的每个Token构造33维特征,信号主要来自三类来源:
- 文本统计特征:从输出本身提取可观察的语言模式;
- 自然语言推理特征:通过NLI模型评估生成内容与外部证据之间的蕴含关系;
- 语言模型惊异度:观察某个Token或片段在语言模型中的意外程度。
这些特征随后输入双向门控循环单元(BiGRU)。与独立逻辑回归不同,BiGRU能够利用前后Token的信息,把一个位置的证据传递给相邻的模糊位置,从而识别更完整的幻觉片段。整个流程只读取生成文本和外部信号,不需要访问目标模型的隐藏状态或其他内部信息。
实验结果说明了什么
在RAGTruth数据集上,BiGRU在10个随机种子下取得0.840的AUC,相比独立逻辑回归基线提升约11个百分点;论文报告的Wilcoxon符号秩检验结果为p=0.002。受控分解实验进一步指出,性能提升主要来自对Token顺序和局部时间关系的利用,而非单纯增加模型容量。
研究还比较了循环模型、状态空间模型Mamba和注意力架构。不同架构的结果都接近0.845的上限,这意味着在当前实验设置下,继续更换序列建模器可能难以带来明显收益,特征本身才是更突出的限制因素。
意义与局限
这项工作的价值在于重新定义了检测单位:幻觉更像一个需要结合上下文解释的连续事件,而不是一串互不相关的错误Token。外部特征设计也让方法具备面向闭源模型部署的可能性;实验显示,面对训练阶段未见过的语言模型生成文本时,AUC下降低于4%。
不过,材料没有提供更完整的数据划分、特征消融细节或不同领域数据上的结果,因此0.840的表现不宜直接视为通用检测能力。实际应用仍需关注外部证据质量、NLI模型偏差以及跨任务迁移效果。总体而言,这项研究为RAG系统和模型输出审查提供了一个清晰方向:先改善可观测信号,再利用序列上下文整合证据。
评论
正在确认登录状态……
正在加载评论……