OPRD:让强模型借助弱教师继续超越教师上限
导语
当模型一代代升级,如何把上一代模型在后训练阶段获得的能力高效传给下一代,是一个现实的工程问题。直接从头进行大规模强化学习成本很高,但传统知识蒸馏又容易让学生围绕教师输出学习,最终受到教师能力上限的约束。论文《Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation》提出 OPRD,尝试让弱教师成为“加速器”,而不是学生必须追随的目标。
核心要点
- 问题从复制能力转向利用进步方向。 弱到强泛化关注的是:更强的学生能否从较弱监督者获得有效经验,并最终超过监督者。论文重点考察连续模型迁移,以及把不同领域教师的后训练成果整合到一个学生模型中的多教师场景。
- OPRD使用学生自己的轨迹。 学生先生成样本,方法再观察弱教师相对于其参考策略发生了怎样的策略变化,并将这个变化与学生由验证器产生的策略梯度进行比较。与其直接要求学生模仿教师,不如利用教师指出的变化方向。
- 只放大被验证器支持的更新。 OPRD不会无条件采纳教师偏好,而是重新缩放那些同时得到验证器支持的梯度分量。由此,学生仍在优化自己的奖励或验证目标;教师信号主要作用于学习速度和更新强度。
- 目标是加速,而非改写终点。 论文的理论动机是,这种选择性重缩放可以保留策略优化的驻点,因此学生有机会越过弱教师,而不是被蒸馏过程固定在教师附近。
- 覆盖多种能力排序。 实验涉及连续模型迁移、多教师蒸馏,也包含通常意义上的强到弱蒸馏。作者报告称,OPRD比现有强化学习和蒸馏基线更早达到竞争方法的最终表现,并取得更高结果。
意义与影响
这项工作的价值在于重新定义教师模型在后训练中的角色。传统蒸馏往往把教师分布当作学生要逼近的目标;OPRD则把教师的策略变化视为一种有条件的优化提示,最终裁决仍交给验证器。这一思路尤其适合模型迭代和多领域能力合并:已有模型的后训练成果可以被复用,同时不必假设教师已经覆盖学生的能力边界。
论文对回答风格的分析还显示,OPRD学生更接近仅使用验证器强化学习训练的模型,而不是简单贴近弱教师。这支持了作者的核心解释:教师指导主要是在加速学生自身的优化,而不是把学生带向另一套固定行为。当然,方法依赖可靠的验证器,也需要处理教师信号与验证目标不一致的情况。总体而言,OPRD为“如何让弱监督帮助强模型继续成长”提供了一种兼顾效率与优化自由度的路径。
评论
正在确认登录状态……
正在加载评论……