返回文章列表
模型评测

LLM 的“显著性偏差”:为什么明明懂常识却会被题目带偏?

阅读约 3 分钟

导语

大语言模型在数学、代码和复杂问答中的表现不断提升,但这并不意味着它们已经稳健掌握了日常常识。一篇题为《Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning》的论文关注了一个很容易被忽视的问题:当题目里出现看似重要、但实际无关的数字或条件时,模型可能会被这些“显眼信息”牵着走,反而忽略现实世界中更基本的前提。

作者将这一问题命名为 Salience Bias(显著性偏差)。它描述的不是模型完全不知道常识,而是模型在任务设定中倾向于优先服从明确写出的条件,哪怕这些条件只是干扰项。

核心要点

  • 显性条件会劫持推理过程:LLM 习惯认真处理用户输入中的数字、限制和指令。这在很多结构化任务里有帮助,但在常识推理中可能变成弱点。例如题目给出大量计算线索时,模型可能忙于推导,却忘了先判断任务在物理或现实层面是否成立。
  • 作者构建了 SaliTrap Benchmark:论文提出一个面向常识陷阱的评测集,覆盖四类陷阱维度,用来测试模型是否会被无用的显性干扰项带偏。
  • 12 个前沿模型均受到影响:评测显示,主流大语言模型都存在不同程度的显著性偏差。干扰项越密集,问题越严重。同时,模型“发现陷阱”和“真正避开陷阱”并不总是一回事。
  • 更像是知识被压制,而不是没有知识:作者进一步去掉原有任务框架,用更直接、无上下文的方式探测模型知识,发现可以恢复超过 90% 的谄媚式服从失败案例。这说明模型内部往往具备相关常识,只是在原题中被显眼干扰项挤出了推理焦点。
  • 轻量提示也能改善表现:论文还指出,不经过重新训练,仅通过推理时提示策略,就能在相当程度上缩小差距。

意义与影响

这项研究把常识推理失败的讨论从“模型到底懂不懂”推进到“怎样把模型知道的东西稳定调出来”。这对评测和应用都有启发:如果一个模型在陷阱题中失败,并不必然说明它缺乏世界知识,也可能是输入格式、任务 framing 或过度服从显性条件导致的。

对实际产品而言,这意味着提示词设计和交互界面需要鼓励模型先检查隐含前提,而不是立刻执行计算或遵循表面指令。对评测体系而言,SaliTrap 这样的基准提醒我们,模型能力不应只看最终答案,还要观察它是否能抵抗无关信息、是否能在发现异常后真正改变推理路径。

总体来看,显著性偏差揭示了 LLM 常识能力中的一个“提取瓶颈”:模型可能知道答案,却在错误的任务框架中把注意力放错了地方。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SULAND v2:面向无人机/无人车地雷识别的RGB数据集与域外评测基准
模型评测
cctest.ai
模型评测

SULAND v2:面向无人机/无人车地雷识别的RGB数据集与域外评测基准

SULAND v2 对原有 RGB 地表地雷数据集进行逐帧审校,修复标注缺失、框定位错误和 OOD 类别 ID 反转等问题,并给出跨架构检测器基准。研究显示,IID 高分并不能直接代表模型可用于真实排雷辅助场景。

阅读全文