同系列模型上的在线策略蒸馏:小教师如何教会大模型推理
导语
强化学习能够让大语言模型获得更强的推理能力,但这种能力能否被另一个模型稳定接收,仍取决于教师与学生的规模、初始能力以及训练方式。论文《Scaling Properties of Same-Family On-Policy Distillation》把问题聚焦到在线策略蒸馏(On-Policy Distillation,OPD):学生先生成自己的答案,再根据教师策略获得逐 token 的反向 KL 监督,从而学习如何改进自身行为。
研究者在同一模型家族内,系统比较了弱到强、同规模基座以及强到弱三类教师—学生关系,并分析模型参数量、教师得分和训练轨迹之间的联系。实验还配套发布了交互式项目页面、训练回放,以及覆盖 Qwen2.5 0.5B 至 14B 的 311 个检查点,便于复核和进一步研究。
核心发现
- 早期训练存在稳定的“有效迁移区间”。 学生在初始化模型基础上训练后,研究以与参考策略的偏离程度衡量训练进展,并发现留出集上的 gold score 与该指标在早期阶段大致呈线性上升关系。也就是说,适度改变策略时,能力提升具有相对规则的轨迹。
- 弱到强迁移并不等于能力受限于教师。 在所有观察到的弱教师—强学生组合中,学生达到的峰值 gold score 都超过了教师自身得分。这说明教师可以提供有用的学习方向,而不必成为学生能力的上限;一个较小的 RL 专家也可能帮助更大模型获得更好的推理表现。
- 教师规模存在有效上限。 峰值 gold score 会随教师规模增加而改善,但这种收益大致持续到教师规模接近学生规模的位置。继续扩大教师,并不意味着学生一定能获得同等幅度的收益。
- 相同得分不代表相同监督价值。 当教师 gold score 匹配时,规模更小的教师反而可能带来更好的迁移效果。因此,教师评测分数只能描述结果,不能完整代表其作为监督信号的质量。
- 论文进一步考察了多种训练因素。 作者拟合了峰值表现和有效迁移斜率随学生规模、教师规模及教师得分变化的幂律,并分析了 OPD 变体、弱到强训练中的自举,以及在线监督比例的影响。
意义与局限
这项工作把“蒸馏能否成功”推进为一个更具体的规模化问题:应该选择多大的教师,学生需要比教师强多少,训练过程又应在何时停止。其重要启示是,教师的价值不应只用最终分数衡量,还应考虑它提供的策略方向、与学生的规模关系以及监督信号是否适合学生当前分布。
对实践而言,研究支持一种更节省资源的路线:先训练相对紧凑的 RL 专家,再通过 OPD 将能力迁移到更大的学生模型。不过,论文结论主要来自同一模型家族及特定实验设置,不能直接推断所有架构、任务或跨家族蒸馏都遵循相同规律。未来仍需验证这些幂律在更广泛数据、奖励机制和模型体系中的稳定性。
评论
正在确认登录状态……
正在加载评论……