SPOT:让大模型在策略蒸馏中学会“看结果再模仿”
导语
On-policy distillation(OPD)正在成为训练推理型大模型的一类重要方法:让学生模型沿着自己生成的轨迹前进,再由更强的教师模型在这些轨迹上提供密集监督。问题在于,标准的反向 KL 训练往往会过度贴近教师在当前位置给出的高概率 token,而没有充分照顾其他同样合理、甚至更可能带来正确答案的延续。
论文 SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation 正是针对这一缺口提出改进。它的核心思想可以概括为:不要在每个位置都盲目蒸馏,也不要只看教师的局部概率;而应先找出最值得探测的位置,再通过后续结果来校准应该学习什么。
核心要点
- OPD 的局限:标准 OPD 能提供密集教师监督,但反向 KL 可能让学生低估多个可行分支,导致解题路径覆盖不足。
- 教师熵并不够用:高熵只能说明教师不确定,却不能说明不确定性是集中在少数候选 token 上,还是分散在长尾中;也不能判断学生是否已经掌握这些候选。
- SPOT 的三阶段流程:方法采用 acquisition、exploration、exploitation 三步,分别解决“在哪里探测”和“蒸馏什么”。
- 稀疏探测位置:在 acquisition 阶段,SPOT 将教师熵、top-k 候选集合捕获的概率质量,以及学生—教师分布差异组合成位置级分数,用有限预算挑选最有价值的 token 位置。
- 用结果校准目标:在 exploration 阶段,方法评估教师提出的候选,并让学生继续生成,再由 verifier 给这些延续打分。exploitation 阶段则把这些结果转化为带 KL 正则的闭式目标,使蒸馏分布既偏向下游表现更好的候选,又不会完全脱离教师分布。
意义与影响
SPOT 的价值在于,它把“局部模仿”推进到“结果感知的模仿”。对于推理任务来说,一个 token 的局部概率并不总能预测最终答案是否正确;某些看似不占优势的候选,可能在后续推导中通向更优路径。SPOT 通过稀疏探测控制额外计算成本,又通过验证器评分把未来结果引入当前训练信号,这使它比单纯依赖教师熵的 EOPD 更细致。
根据摘要中的实验结果,SPOT 在三个学生模型规模和多个推理基准上,相比 OPD 的 macro Avg@8/Pass@8 提升为 0.47–1.48/4.55–5.28 个点,相比 EOPD 也提升 0.29–0.68/2.49–3.19 个点。这说明,在推理蒸馏中,覆盖更多高质量解题路径可能比机械复制教师概率更重要。
对大模型训练实践而言,SPOT 提供了一种折中方案:不全面展开昂贵搜索,而是在信息量最大的分歧点上“少量多次地看未来”。如果后续研究能进一步降低 verifier 成本,并验证其在更复杂任务上的稳定性,这类 outcome-calibrated distillation 可能会成为提升小模型推理能力的重要方向。
评论
正在确认登录状态……
正在加载评论……