返回文章列表
模型评测

会解题不等于会推理:研究发现推理模型缺乏系统性

阅读约 3 分钟

导语

推理模型越来越擅长在复杂提示下给出正确答案,但“答对一道题”与“真正掌握这类问题的结构”并不是同一件事。来自 Princeton University 的 Simon Schug 与 Brenden M. Lake 在论文《Thought without systematicity? Evaluating reasoning models on rule induction tasks》中,借助规则归纳任务,专门检验模型是否具备人类认知中的“系统性”。

系统性可以理解为:如果一个系统理解了某个概念,也应当能够理解与之结构相近的变化形式。例如,问题中的对象、符号或组合顺序发生变化时,底层规则没有改变,系统仍应给出一致的推理结果。对语言模型而言,这一性质关系到它们究竟是在执行可迁移的推理,还是在依赖训练和提示中的表面模式。

核心要点

  • 从规则归纳切入。 研究沿用了认知科学中用于考察概念学习与规则发现的任务类型,而不是只依赖常见的问答或数学基准。
  • 测试结构等价性。 每个任务家族都具有组合结构,研究者利用任务同构构造变体,包括重新组合已有成分,以及替换具体符号或对象。
  • 原题答对,变体未必答对。 研究发现,模型经常能够解决某个任务,却无法稳定处理结构上等价的变体。也就是说,正确答案并不总能反映出对底层规则的掌握。
  • 挑战现有评测方式。 如果评测只使用有限的表面形式,模型可能凭借熟悉的模式取得好成绩,却在轻微改写后暴露出不一致。

这意味着什么

这项工作并不是简单断言推理模型“不会推理”,而是提出了更严格的判断标准:推理能力应当在结构保持不变的情况下,对重组、替换等变化保持稳健。对于模型评测,这意味着测试集需要覆盖更多等价变换,而不能只统计单一题面上的准确率。报告模型成绩时,也应关注同一任务不同变体之间的一致性。

对模型开发者而言,结果提示训练和推理策略可能仍在很大程度上依赖上下文、符号表面或特定任务模板。未来的改进方向包括构造系统性更强的训练数据、加入等价变换下的一致性约束,并区分“找到正确答案”和“掌握可迁移规则”这两个目标。

更广泛地看,这项研究提醒我们,链式思考或更长的推理过程本身并不能自动证明模型拥有稳健的认知能力。只有当模型能够把同一规则应用到未见过、但结构等价的情境中,评测者才更有理由认为它的能力超越了特定基准的表面表现。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Benchmark Radar:把 AI 基准测试检索变成一项可追溯的基础设施
模型评测
cctest.ai
模型评测

Benchmark Radar:把 AI 基准测试检索变成一项可追溯的基础设施

Benchmark Radar 是一个持续更新的 AI 基准测试数据库与搜索引擎,聚合论文、代码仓库、数据集、模型卡和技术报告中的评测证据。它试图帮助研究者更快找到相关基准,并在比较分数时看到实验设置、来源和使用趋势。

阅读全文
CCTest · Blog
LLM裁判也会偏心:能力越强的模型,越容易拿到宽松评分
模型评测
cctest.ai
模型评测

LLM裁判也会偏心:能力越强的模型,越容易拿到宽松评分

一项覆盖四个基准、六个模型的研究显示,LLM作为自动评审员时,评审能力与自身任务能力高度相关,但也会对更强的被评模型系统性放宽标准。研究提出无需真实标签的加权多裁判校准方法,以降低这种偏差。

阅读全文