返回文章列表
强化学习

OPD²:用“差分信号”改进大模型在线策略蒸馏

阅读约 3 分钟

导语

大模型后训练正在从单纯依赖奖励模型的强化学习,走向更多元的监督与优化方式。NAVER AI Lab 的论文《On-Policy Delta Distillation》提出了一种新的在线策略蒸馏方法 OPD²(On-Policy Delta Distillation):与其让学生模型直接模仿教师模型的完整输出分布,不如让它学习教师模型相对于其基础模型“多出来的那部分能力”。

这听起来像一个细微改动,但它瞄准的是推理模型蒸馏中的一个关键问题:教师模型的输出并不全是推理调优带来的新能力,其中也包含基础语言建模能力、表达偏好和大量背景知识。如果学生模型把这些全部照单全收,训练信号可能会变得冗余甚至不够聚焦。

核心要点

  • 从“模仿教师”转向“模仿增量”:传统在线策略蒸馏通常使用教师模型的 token 级输出作为监督。OPD² 则引入 delta signal,即推理调优后的教师模型与其调优前基础模型之间的差异。
  • 更直接地迁移推理能力:论文认为,这个差异更能反映指令调优或推理调优实际带来的变化,因此比完整教师分布更适合作为推理能力迁移信号。
  • 仍然属于在线策略蒸馏框架:方法并不是完全抛弃强化学习式后训练,而是在 on-policy distillation 中重新设计蒸馏奖励,让学生在自身生成轨迹上获得更有针对性的 token 级反馈。
  • 实验覆盖多类推理任务:作者报告称,OPD² 在数学、科学和代码推理基准上持续优于常规在线策略蒸馏。
  • 跨模型设置具备一致性:素材显示,增益不仅出现在多个 Qwen3 模型尺寸上,也覆盖 thinking 与 non-thinking 两种模式,并可推广到 Gemma 4。

为什么这个设计值得关注

在线策略蒸馏的吸引力在于,它绕开了奖励模型的一些限制:不必完全依赖一个可能偏置或难以校准的标量奖励,而是直接使用教师模型给出的 token 级监督。不过,教师监督本身也有设计空间。OPD² 的贡献就在于把问题从“教师说什么就学什么”改成“学教师相对于原始基座改变了什么”。

这种思路在推理模型场景尤其自然。许多 reasoning LLM 是在强基座模型上经过后训练得到的,其提升并不是凭空出现,而是体现在某些 token 选择、解题步骤组织、思维链展开或代码推理偏好上。通过减去基础模型的影响,delta signal 试图突出这些后训练诱导出的变化。

意义与影响

如果论文结果能够在更多模型和任务中复现,OPD² 可能为高效训练小型或中型推理模型提供一条实用路径:用较短的后训练周期,把大型推理教师中的关键能力迁移出来,而不是复制全部行为模式。

它也提示后训练研究的一个方向:蒸馏信号并非只能来自教师模型本身,还可以来自教师与其历史版本、基础模型或不同能力状态之间的对比。对 AI 团队而言,这意味着已有的模型谱系可能本身就是一种可利用的训练资源。

当然,素材主要来自论文摘要与页面信息,尚无法判断 delta signal 在更开放任务、长上下文场景或真实产品负载中的稳定性。但作为一种简洁且目标明确的蒸馏奖励设计,OPD² 为推理能力迁移提供了一个值得继续验证的思路。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
CPO:用“正确性感知”替代单纯熵信号的 RLVR 新思路
强化学习
cctest.ai
强化学习

CPO:用“正确性感知”替代单纯熵信号的 RLVR 新思路

这篇论文提出 Contrastive Policy Optimization(CPO),尝试解决 RLVR 中把熵当作优势塑形信号时无法区分“有益不确定性”和“有害混乱”的问题。它通过比较参考引导生成与普通生成的 token 级分布差异,为训练提供更接近正确性的信号。

阅读全文