SAF-OPD:让强化学习与在线蒸馏更稳定地合流
导语
在大模型后训练中,强化学习与蒸馏常被视为两条互补路线:前者依靠可验证奖励推动模型自己探索正确解法,后者借助更强教师模型提供更密集的学习信号。问题在于,互补并不等于可以直接相加。论文 SAF-OPD: Stable Advantage Fusion for On-Policy Distillation 讨论的正是这个细节:当 GRPO 这类基于可验证奖励的强化学习,与在线策略蒸馏 OPD 用固定权重融合时,训练可能出现熵坍缩,模型变得过早“听老师的话”,反而限制了继续超越教师的空间。
核心要点
- RLVR 与 OPD 的信号形态不同。 RLVR 通常把一个回答级奖励广播到每个 token 上,信号稀疏但来自可验证结果;OPD 则逐 token 对照教师模型打分,提供更细粒度的 advantage,但天然会把学生拉向教师分布。
- 固定系数融合会产生幅度错配。 论文指出,部分 token 的 OPD advantage 可能远高于有界的 GRPO advantage。一旦这些值主导梯度更新,来自可验证奖励的探索信号就会被淹没。
- 还存在时序错配。 如果 OPD 在整个训练过程中始终保持满强度,学生会持续贴近教师。短期看 KL 距离更低,似乎更“稳定”;但长期看可能导致熵下降、回答长度异常增长,并更早进入性能平台期。
- SAF 只调节 OPD advantage。 方法没有引入额外模型、辅助损失或额外前向计算,而是在 OPD advantage 上依次应用 Top-k 稀疏化、tanh 有界压缩、KL 触发预热和线性退火。四个阶段都可以独立开关。
- 实验覆盖数学推理与代码生成。 作者以 GRPO 作为 RLVR 实例,在 Qwen3-1.7B、4B、8B 上评测七个数学与代码基准。相比固定系数的 GRPO+OPD,SAF 在六个模型-领域设置中的综合分数提升 0.51% 至 2.70%,同时训练更稳定。
意义与影响
这篇工作的价值不在于提出一个庞大的新训练范式,而在于指出“教师信号并非越强越好”。在后训练实践中,蒸馏常被用来提升样本效率,但当目标是让学生在可验证任务中继续探索、甚至超过教师时,过强且持续的教师约束可能成为上限。
SAF 的设计思路也比较务实:先用稀疏化与压缩解决 token 级信号幅度过大的问题,再用预热与退火处理不同训练阶段对教师依赖程度不同的问题。这种做法把 OPD 从“固定牵引力”变成“可调节的辅助导航”。对正在构建数学推理、代码生成或其他可验证奖励训练管线的团队来说,它提供了一个低成本的融合策略:不必改变主干 RL 算法,也不需要新增教师推理开销,就能减少固定融合带来的训练不稳定。
更重要的是,论文提醒我们评估后训练方法时不能只看学生与教师是否更接近。固定融合可能带来更低的 student-teacher KL,但这并不保证最终任务表现更好。真正有效的训练,往往需要在模仿与探索之间动态分配信任。
评论
正在确认登录状态……
正在加载评论……