返回文章列表
模型评测

LLM智能体不只要答对,还要知道自己可能错

阅读约 3 分钟

导语

当检索到的证据与语言模型原有知识发生冲突时,一个智能体真正的能力,不只是给出一个看似确定的答案,还包括判断自己是否有理由确信。它会修正结论、明确说明证据矛盾,还是继续沿用先前的判断?这正是论文《Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict》关注的问题。

现有智能体评测通常把任务是否完成、答案是否正确作为核心指标,但这类指标难以揭示系统面对不一致信息时的行为过程。论文因此引入“认知谦逊”(Epistemic Humility,EH),将其理解为智能体在执行任务时识别、处理并传达不确定性的意愿与能力。

核心要点

  • 用ISE刻画认知谦逊。 研究从完整执行轨迹出发,设置三个行为维度:Identify,即发现知识或证据冲突;Solve,即采取行动核查、整合或解决冲突;Escalate,即在无法确定时向用户或更高层流程明确升级、报告不确定性。
  • 覆盖两类知识冲突。 一类是受控冲突,即模型参数知识与检索证据不一致;另一类是在多步智能体执行中自然出现的冲突,例如不同上下文来源彼此矛盾。两类场景都配有匹配的无冲突对照。
  • 准确率与谦逊并不等价。 对四个智能体的评估显示,一些配置能够在执行过程中注意到冲突,却在最终答案中没有保留对未解决不确定性的说明,甚至给出错误但语气确定的结论。
  • 冲突意识可能在流程中丢失。 轨迹分析发现,智能体常在早期步骤捕捉到矛盾,但在后续推理、工具调用或答案生成阶段未能持续跟踪并解决它。
  • 改进存在权衡。 针对模型层面的干预可以提升EH,但往往伴随任务准确率下降。这说明认知谦逊并非只由底层模型决定,也取决于智能体框架和评测环境之间的组合。

意义与影响

这项工作把“会不会承认不确定”从抽象的模型品质,转化为可以沿执行轨迹观察的评测问题。对医疗、法律、研究检索和企业流程等高风险场景而言,系统即使偶尔答错并不是唯一问题;更危险的情况,是它已经遇到相互矛盾的证据,却在最终输出中隐藏这种冲突。

研究也提示,智能体评测不能只看最终成功率。未来的测试可以同时记录冲突识别、证据核查、状态记忆和升级沟通等环节,并区分“答对但没有说明依据”和“答错却清楚披露不确定性”这两种不同表现。与此同时,提升谨慎程度不能简单等同于让模型更常说“我不确定”,还需要检验它是否采取了有效行动,以及这种谨慎是否会妨碍正常任务完成。更可靠的智能体,或许不是永远自信,也不是一味保守,而是在证据发生变化时能够持续更新判断,并把尚未解决的问题清楚交代出来。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章