不模仿正确答案,LLM开始从错误推理中学习
导语
让语言模型变得更会推理,通常意味着让它学习更好的解题过程。在线自蒸馏(On-Policy Self-Distillation,OPSD)就是其中一条路线:模型既负责生成答案,也可以借助真实解答等特权信息扮演教师,引导学生模型调整分布。不过,题为《Negative Self-Distillation: Learning to Reason by Avoiding Flaws》的工作提出了一个相反的问题:如果模型不去模仿“标准过程”,而是学习避开错误过程,会不会更适合复杂推理?
核心要点
- 反思传统蒸馏的副作用:当教师轨迹依赖真实答案或其他特权信息时,它可能显得异常确定、连贯。学生若被强制复制这种轨迹,可能逐渐减少对不确定性的表达,也不再充分尝试、回溯和自我修正。
- 构造负面教师:Negative Self-Distillation(NSD)不要求外部教师或人工标签,而是让模型针对当前问题生成一个“粗心推理者”等负面条件,再推动学生的输出分布远离这条有缺陷的轨迹。
- 避免把语言能力一起遗忘:简单套用反学习或惩罚目标存在风险。错误推理中的 token 往往与“因此”“因为”等普通语言 token 混杂,若不加区分地降低它们的概率,可能损害模型的基本表达能力。
- 动态门控是关键环节:NSD据介绍通过动态门控机制识别推理关键 token,将梯度更新集中在更可能影响推理质量的部分,而不是全面惩罚负面序列。
意义与局限
NSD的价值不只是把蒸馏方向从“靠近正确答案”改成“远离错误答案”,更在于它提供了一种无标签、自举式的训练视角:模型自身的失败轨迹也可以成为学习信号。对于需要多步搜索、试错和校正的问题,这种目标或许比单纯复制一条高度压缩的正确路径更能保留推理过程中的弹性。
但需要谨慎的是,现有素材没有给出完整方法细节、实验设置或性能数据,也没有说明负面条件的生成成本与稳定性。因此,NSD能否普遍优于传统自蒸馏,仍需要论文全文和独立复现实验验证。更现实的应用方向,可能是将正向监督与负向约束结合:既利用可靠解答提供方向,又用模型生成的缺陷轨迹提醒训练过程不要固化错误模式。
评论
正在确认登录状态……
正在加载评论……