返回文章列表
大语言模型

SPOT:让大模型在策略蒸馏中学会“看结果再模仿”

阅读约 3 分钟

导语

On-policy distillation(OPD)正在成为训练推理型大模型的一类重要方法:让学生模型沿着自己生成的轨迹前进,再由更强的教师模型在这些轨迹上提供密集监督。问题在于,标准的反向 KL 训练往往会过度贴近教师在当前位置给出的高概率 token,而没有充分照顾其他同样合理、甚至更可能带来正确答案的延续。

论文 SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation 正是针对这一缺口提出改进。它的核心思想可以概括为:不要在每个位置都盲目蒸馏,也不要只看教师的局部概率;而应先找出最值得探测的位置,再通过后续结果来校准应该学习什么。

核心要点

  • OPD 的局限:标准 OPD 能提供密集教师监督,但反向 KL 可能让学生低估多个可行分支,导致解题路径覆盖不足。
  • 教师熵并不够用:高熵只能说明教师不确定,却不能说明不确定性是集中在少数候选 token 上,还是分散在长尾中;也不能判断学生是否已经掌握这些候选。
  • SPOT 的三阶段流程:方法采用 acquisition、exploration、exploitation 三步,分别解决“在哪里探测”和“蒸馏什么”。
  • 稀疏探测位置:在 acquisition 阶段,SPOT 将教师熵、top-k 候选集合捕获的概率质量,以及学生—教师分布差异组合成位置级分数,用有限预算挑选最有价值的 token 位置。
  • 用结果校准目标:在 exploration 阶段,方法评估教师提出的候选,并让学生继续生成,再由 verifier 给这些延续打分。exploitation 阶段则把这些结果转化为带 KL 正则的闭式目标,使蒸馏分布既偏向下游表现更好的候选,又不会完全脱离教师分布。

意义与影响

SPOT 的价值在于,它把“局部模仿”推进到“结果感知的模仿”。对于推理任务来说,一个 token 的局部概率并不总能预测最终答案是否正确;某些看似不占优势的候选,可能在后续推导中通向更优路径。SPOT 通过稀疏探测控制额外计算成本,又通过验证器评分把未来结果引入当前训练信号,这使它比单纯依赖教师熵的 EOPD 更细致。

根据摘要中的实验结果,SPOT 在三个学生模型规模和多个推理基准上,相比 OPD 的 macro Avg@8/Pass@8 提升为 0.47–1.48/4.55–5.28 个点,相比 EOPD 也提升 0.29–0.68/2.49–3.19 个点。这说明,在推理蒸馏中,覆盖更多高质量解题路径可能比机械复制教师概率更重要。

对大模型训练实践而言,SPOT 提供了一种折中方案:不全面展开昂贵搜索,而是在信息量最大的分歧点上“少量多次地看未来”。如果后续研究能进一步降低 verifier 成本,并验证其在更复杂任务上的稳定性,这类 outcome-calibrated distillation 可能会成为提升小模型推理能力的重要方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
可解释性不再是性能税?Steerling-8B 探索“生来透明”的语言模型
大语言模型
cctest.ai
大语言模型

可解释性不再是性能税?Steerling-8B 探索“生来透明”的语言模型

这篇技术报告提出一种训练期可解释语言模型路线:不是在模型训练后再解释黑箱,而是把可解释性作为训练目标的一部分。其代表模型 Steerling-8B 试图在生成结果、输入 token、概念与训练数据之间建立可追溯关系。

阅读全文
CCTest · Blog
无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习
大语言模型
cctest.ai
大语言模型

无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习

这篇论文提出 U-OPSD:只利用模型自身多次生成结果的一致性来构造伪答案,并在分歧样本上进行自蒸馏。实验显示,该方法在数学推理基准上可稳定提升 Qwen3 等模型表现,并能匹敌或超过带真值监督的方法。

阅读全文