返回文章列表
模型评测

Enoki:用统一事实表示提升大模型幻觉检测效率

阅读约 3 分钟

大型语言模型能生成流畅答案,却不一定能保证每个事实都可靠。在医疗、法律、科研等高风险场景中,系统不仅要回答“这段话是否正确”,还要指出“具体哪一部分缺乏证据”。围绕这一需求,论文《Enoki: Efficient Multi-Level Hallucination Detection》提出了一个面向多层级幻觉检测的开放信息抽取框架。

导语:从“是否错误”走向“错在哪里”

现有方法通常在两个层级之一上工作。声明级检测会把回答拆成若干可验证的事实单元,便于判断每条陈述是否得到证据支持;片段级检测则直接定位原文中疑似幻觉的词语或短语。前者更适合解释和事实核验,后者更适合编辑、审查和用户提示,但二者往往各自构建流程。

要同时覆盖这两个层级,传统方案可能需要多次调用大模型完成文本分解、事实核验和结果对齐。即使采用模块化组件,也通常还要额外建立“声明—文本片段”的对应关系。这种重复处理会增加推理成本,也可能让不同阶段的判断出现偏差。

核心要点

  • 以关系事实作为共享表示。 Enoki 从文本中抽取带有原文位置锚点的关系事实,例如实体之间的属性、行为或关联。事实既是声明级验证的基本单元,也保留了其在原文中的位置。
  • 先核验,再回溯定位。 框架将抽取出的事实与证据进行比较,识别不受支持的事实,并利用原有文本锚点将其投射回相关片段,从而避免单独训练或设计声明到片段的对齐模块。
  • 兼容不同抽取路线。 Enoki 提供统一接口,可接入基于大模型、编码器或规则的抽取方案。使用者可以在检测质量和推理资源之间进行取舍,而不必改变后续验证与定位流程。
  • 覆盖多个粒度。 论文报告称,该方法在声明级任务上能够与较强系统保持竞争力,同时在细粒度的片段级和实体级定位方面表现更好,并使用更少资源。
  • 发布双粒度数据集。 配套的 EnokiQA 同时提供声明级事实核验和片段级定位标注,为统一评估两类能力提供了数据基础。

意义与影响

Enoki 的价值不只是增加一个幻觉分类器,而是尝试把“判断事实真伪”和“指出错误位置”放进同一条处理链路。对于检索增强生成、自动报告审查或高风险问答系统,这种设计可以让检测结果更接近实际使用需求:系统既能说明某个事实没有得到证据支持,也能告诉开发者或用户应当检查回答中的哪一段。

从工程角度看,共享表示还可能降低多阶段流水线的复杂度。尤其当应用需要在不同规模的模型和不同成本预算之间切换时,抽取器与验证器的解耦有助于复用系统组件。不过,素材目前主要提供了框架概念、数据集发布和总体实验结论,尚未给出具体基准分数、计算成本或错误案例。因此,Enoki 的实际优势仍需结合论文完整实验和不同领域数据进一步判断。

总体来看,Enoki 把幻觉检测从单一的真假判断,推进到“事实核验、位置定位和实体级诊断”的统一视角。它所强调的文本锚定关系事实,也为后续构建更可解释、更节省资源的模型评测工具提供了一个清晰方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章