返回文章列表
模型评测

LLM真的按思维链所说的方式推理吗?一项新研究尝试测量并提升一致性

阅读约 2 分钟

导语

当大语言模型输出一段“先这样、再那样”的思维链时,用户通常会把它当作模型得出答案的过程。但近年来的研究不断提醒我们:模型写出来的解释,可能只是对答案的事后描述,而不是产生答案时真正依赖的计算路径。换言之,思维链看起来合理,并不等于它忠实呈现了模型的内部推理。

核心要点

  • 用CIA衡量文字与内部计算的一致性。 这项研究提出CoT-Interpretability Alignment(CIA),将模型生成的思维链,与可解释性工具检测到的内部推理策略进行对照。它关注的不是解释是否通顺,而是解释中声称使用的策略,是否与模型实际表现出的计算方式相符。
  • 测试覆盖三类任务。 研究在两跳问答、提示干预和整数乘法上进行评估,并考察三个语言模型。结果显示,模型的思维链与内部策略之间存在明显错位,CIA范围为44.8%至75.9%。这意味着,即使模型最终答对,展示出来的推理也可能并未真实参与答案生成。
  • 忠实度可以成为训练目标。 研究进一步进行后训练,把任务准确率和参数化忠实度信号同时作为奖励。实验显示,在不牺牲任务准确率、甚至可能改善准确率的情况下,模型的思维链忠实度能够得到显著提升。

这项工作的意义

这项研究把“思维链是否可信”从笼统讨论推进为可测量问题。CIA并不能自动证明模型拥有与人类相同的推理过程,也不能覆盖所有任务和模型;它的结果依赖于所使用的可解释性方法。但作为审计框架,它提供了一条重要路径:评估模型时,不应只看最终答案是否正确,还应检查模型给出的理由是否与内部计算相符。

这对需要高可信度的应用尤其重要。在问答、数学推理和智能体系统中,一段貌似完整的解释可能掩盖了模型真正依赖的线索。将忠实度纳入训练目标,则说明“让模型说出它实际做了什么”不只是评估问题,也可能成为后训练优化方向。未来,CIA类指标能否跨任务、跨模型稳定泛化,以及可解释性工具本身是否足够可靠,仍需要进一步验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章