返回文章列表
强化学习

Distilled RL:把教师模型的知识“蒸馏”进强化学习后训练

阅读约 3 分钟

导语

大语言模型的后训练通常要在推理能力、任务适应和对齐之间取得平衡。当前常见路线大致分为两类:一类是强化学习,通过最终答案或整体结果给奖励;另一类是在线策略蒸馏,让学生模型在生成过程中模仿教师模型的概率分布。论文《Distilled Reinforcement Learning for LLM Post-training》提出的 Distilled RL,正是试图把这两条路线重新组合:保留 RL 的奖励驱动,又让教师模型在 token 层面提供更细的学习信号。

核心要点

  • 问题一:传统 RL 的监督太粗。 标准 RL 往往只知道一个回答最终是好是坏,却难以判断中间哪些 token 或推理步骤贡献更大,信用分配困难,也不擅长从教师那里吸收新知识。
  • 问题二:在线蒸馏容易“照抄”。 OPD 通常通过 KL 散度让学生匹配教师 logits。如果教师和学生很相似,新增信息有限;如果差异很大,教师分布又可能变成低效甚至不稳定的指导。
  • Distilled RL 的做法:选择性引入教师偏好。 方法使用反向重要性采样,比较教师与旧学生策略对学生已生成 token 的相对偏好,并通过裁剪限制极端比值。
  • 只在正向样本上加强教师指导。 对优势值为正的回答,教师偏好会重新加权 token 级策略梯度;对负优势回答,则重置权重,让更新退回普通 RL,避免对失败轨迹进行错误模仿。
  • 序列级几何归一化。 该步骤去除整段回答层面的尺度偏移,同时保留教师对不同 token 的相对偏好,从而降低不同序列之间的偏置。

实验与结果

论文以 Qwen3-8B-GRPO 作为教师,在三个学生模型上进行评估,并报告了十个数学推理基准的平均 Pass@1。DeepSeek-R1-Distill-Qwen-1.5B 从基础模型的 31.70 提升到 Distilled RL 的 40.00;Qwen3-1.7B 达到 46.37;Qwen3-4B 达到 58.96。相比标准 RL、OPD 以及 OPD+RL 的直接组合,Distilled RL 在这些设置中都取得了更高结果。论文还指出,该方法在同族和跨族蒸馏场景中均有收益,并在 Pass@1 与 Pass@k 上表现更好。

意义与影响

Distilled RL 的价值不在于简单叠加“蒸馏 + 强化学习”,而在于重新定义教师模型的角色:教师不是最终要被复制的对象,而是帮助学生在奖励有效的轨迹上分配学习注意力的信号源。这对 LLM 后训练尤其重要,因为推理任务中一个回答的成败常由少数关键步骤决定。如果教师偏好能够更准确地定位这些位置,学生模型就可能以更高效率吸收原本缺失的知识。

当然,素材展示的结果主要集中在数学推理基准,方法在更开放任务、对齐场景以及不同规模教师模型下的稳定性仍需要更多验证。但从方法设计看,Distilled RL 为“如何把更强模型的知识注入 RL 后训练”提供了一个清晰且可解释的方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
GEPO:给混合任务里的大模型强化学习加上“分组熵”调节器
强化学习
cctest.ai
强化学习

GEPO:给混合任务里的大模型强化学习加上“分组熵”调节器

GEPO 是对 GRPO 的轻量改造,核心不是简单压高熵或保低熵,而是按 prompt 分组的熵状态,去做更细粒度的优势项塑形。它试图解决混合任务训练中,不同题型探索需求不一致、导致统一熵控制失灵的问题。

阅读全文