教师可能并未真正教会模型:一项对在策略蒸馏的重新审视
导语
在策略蒸馏(On-Policy Distillation,OPD)常被视为强化学习与监督微调之间的一座桥梁。它让学生模型先自行生成轨迹,再由教师模型为每个 token 提供更密集的学习信号,相比只在结果层面给出奖励的 RLVR,这种方式理论上更容易训练推理能力。
但一个关键问题长期存在:学生生成的内容并不是教师策略产生的,因此对教师来说属于“离策略”数据。教师在这些轨迹上的评分究竟有多可靠?学生的进步到底来自教师知识,还是来自某种更简单的优化偏置?论文《Does On-Policy Distillation Really Distill?》正面检验了这一问题。
核心发现
- 教师监督含有明显噪声。 研究者对 OPD 训练过程中的教师信号进行了定量分析,发现噪声并非偶发现象,而且教师规模越大,噪声出现得越多。
- 学生对噪声并不敏感。 无论保留这些疑似噪声的监督,还是将其过滤掉,学生策略最终都能收敛到相近表现。这削弱了“教师精确指导决定训练收益”的直觉解释。
- 学习集中在低概率 token。 进一步分析显示,训练更新主要作用于学生自身 log 概率较低的 token。也就是说,OPD 的核心效果可能是压低那些不太可能、容易造成不稳定行为的尾部 token。
- 教师信号并非必要。 实验表明,给所有相关位置使用同一个固定的负优势,也能达到与教师提供的优势信号相近的效果。
从蒸馏到自适应
基于上述观察,研究者提出了无需教师、无需额外监督的 On-Policy Self-Adaptation(OPSA)。该方法利用模型自身的不确定性,也就是 token 分布的熵,决定更新强度:在高熵位置施加更强的信号,抑制尾部 token,同时将概率质量更均匀地重新分配给头部 token。
在 Qwen3-1.7B 基线上的报告结果中,OPSA 在 AIME24 的 Avg@32 提升了 35.41 分,相对增幅为 263%;在三个基准上,Pass@32 均实现了超过一倍的提升。这里的结果支持了论文的主要判断:部分 OPD 收益可能来自对自身低概率输出的结构化修正,而不一定来自教师模型的有效知识迁移。
意义与边界
这项工作并不是简单宣称教师模型毫无价值,而是提醒研究者重新拆解 OPD 的收益来源。如果真正关键的是尾部 token 抑制,那么昂贵的教师推理和复杂的优势估计未必总是必要,模型自身的不确定性也可能提供足够的训练信号。
同时,现有素材只呈现了论文摘要及部分页面信息,关于完整实验设置、噪声定义、不同模型和任务上的稳定性,以及 OPD 与其他方法的完整对比,仍需结合论文全文判断。因此,OPSA 更适合作为一种有潜力的自适应训练思路,而不是已经普遍取代教师蒸馏的定论。
评论
正在确认登录状态……
正在加载评论……