返回文章列表
大语言模型

不模仿正确答案,LLM开始从错误推理中学习

阅读约 2 分钟

导语

让语言模型变得更会推理,通常意味着让它学习更好的解题过程。在线自蒸馏(On-Policy Self-Distillation,OPSD)就是其中一条路线:模型既负责生成答案,也可以借助真实解答等特权信息扮演教师,引导学生模型调整分布。不过,题为《Negative Self-Distillation: Learning to Reason by Avoiding Flaws》的工作提出了一个相反的问题:如果模型不去模仿“标准过程”,而是学习避开错误过程,会不会更适合复杂推理?

核心要点

  • 反思传统蒸馏的副作用:当教师轨迹依赖真实答案或其他特权信息时,它可能显得异常确定、连贯。学生若被强制复制这种轨迹,可能逐渐减少对不确定性的表达,也不再充分尝试、回溯和自我修正。
  • 构造负面教师:Negative Self-Distillation(NSD)不要求外部教师或人工标签,而是让模型针对当前问题生成一个“粗心推理者”等负面条件,再推动学生的输出分布远离这条有缺陷的轨迹。
  • 避免把语言能力一起遗忘:简单套用反学习或惩罚目标存在风险。错误推理中的 token 往往与“因此”“因为”等普通语言 token 混杂,若不加区分地降低它们的概率,可能损害模型的基本表达能力。
  • 动态门控是关键环节:NSD据介绍通过动态门控机制识别推理关键 token,将梯度更新集中在更可能影响推理质量的部分,而不是全面惩罚负面序列。

意义与局限

NSD的价值不只是把蒸馏方向从“靠近正确答案”改成“远离错误答案”,更在于它提供了一种无标签、自举式的训练视角:模型自身的失败轨迹也可以成为学习信号。对于需要多步搜索、试错和校正的问题,这种目标或许比单纯复制一条高度压缩的正确路径更能保留推理过程中的弹性。

但需要谨慎的是,现有素材没有给出完整方法细节、实验设置或性能数据,也没有说明负面条件的生成成本与稳定性。因此,NSD能否普遍优于传统自蒸馏,仍需要论文全文和独立复现实验验证。更现实的应用方向,可能是将正向监督与负向约束结合:既利用可靠解答提供方向,又用模型生成的缺陷轨迹提醒训练过程不要固化错误模式。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
NCP-ArchPreview:让语言模型从预测下一个词走向预测下一个概念
大语言模型
cctest.ai
大语言模型

NCP-ArchPreview:让语言模型从预测下一个词走向预测下一个概念

NCP-ArchPreview在传统下一词预测之外,引入覆盖多个词元的下一概念预测,将离散概念空间纳入语言模型训练。技术报告显示,该8.9B参数模型在更少训练词元和计算量下取得了具有竞争力的预训练与下游表现。

阅读全文
CCTest · Blog
大模型为何会回答无解问题?研究发现关键不在“不会识别”
大语言模型
cctest.ai
大语言模型

大模型为何会回答无解问题?研究发现关键不在“不会识别”

一项针对1.7B至70B规模指令模型的研究发现,模型往往已经在内部识别出数学和代码问题的结构性不可解,却没有把这一信号路由为拒答行为。问题更像是“识别—行动”之间的错配,而非能力缺失。

阅读全文