返回文章列表
模型评测

LLM数学推理的短板,可能不在计算而在“发现”

阅读约 3 分钟

导语

大语言模型已经能够解决不少高难度数学题,但一个关键问题仍未解决:模型是真的理解了数学结构,还是只是生成了看似合理的解题步骤?论文《The Missing Primitive》没有把注意力停留在答案对错上,而是尝试拆开数学推理的内部环节,寻找模型“会做”和“会理解”之间的差距。

把数学推理拆成四种能力

研究提出“数学原语”(Mathematical Primitive)这一概念,用来描述解决数学问题时所需的结构化、可复用知识或操作,并据此构建PRIM基准。该基准从四个维度考察模型:

  • 发现(Discovery):能否从题目中找出适用的定理、关系或解题结构;
  • 生成(Generation):能否把发现的数学结构转化为有效的表达或步骤;
  • 理解(Digestion):能否读懂并吸收已有的数学推导;
  • 执行(Execution):能否准确完成计算、变形和后续推理。

这种划分的重要性在于,最终答对或答错并不能完整反映模型的能力。两个模型可能取得相近的解题准确率,却在“找方法”和“执行方法”上呈现完全不同的画像。研究还观察到,当数学原语被明确提供时,模型原本隐藏的执行能力可以得到明显释放,说明部分失败并非来自计算能力不足,而是没有找到正确的结构入口。

主要瓶颈是发现,而非执行

论文的系统诊断将Discovery视为数学推理中的主要瓶颈。模型往往能够沿着给定的定理、公式或中间结构继续推导,却难以在陌生问题中主动识别最关键的数学原语。这也解释了为什么增加更长的思维链,并不必然解决所有数学问题:如果起点或解题框架选错,后续步骤越多,错误可能只是被延长。

研究进一步指出,受“发现能力”限制的失败尤其适合修复。换言之,后训练不一定要对所有完整答案进行统一强化,而可以先识别模型缺少的原语,再针对性地训练其发现和调用这些结构的能力。

从诊断走向修复

基于上述发现,作者提出ABSORB,一种“原语特权”自蒸馏框架。它的核心思路是筛选并迁移由数学原语引导的推理过程,让学生模型学习的不只是最终答案,也包括解决问题时应当调用哪些结构。论文报告称,该方法在不同模型规模和具有挑战性的数学基准上,相比相关基线持续改善数学推理表现。

意义与局限

这项工作提供了一种比单一准确率更细的评估视角:数学推理可以被看作从发现结构到执行步骤的能力链条。对模型开发者而言,PRIM有助于定位失败发生在哪个环节;对后训练而言,ABSORB则展示了按能力缺口进行选择性修复的方向。

不过,现有素材并未提供具体实验数字,也未说明四类能力在所有数学任务中的普适边界。因此,这项研究更适合作为诊断框架和训练思路,而不是对模型“真正理解数学”的最终定论。其价值正在于把一个笼统问题拆成了可以分别测量、分析和改进的组成部分。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章