返回文章列表
强化学习

CriPO:用自蒸馏补上 Rubric 强化学习的“缺失信号”

阅读约 2 分钟

导语

在开放式任务中,用单一奖励去评价大模型回答往往过于粗糙。因此,Rubric-based RL(基于评分细则的强化学习)开始受到关注:它把任务拆成多个可检查的标准,让模型不仅追求“总体看起来不错”,也尽量覆盖关键要求。

这篇论文指出,当前 Rubric-based RL 的难点不只是探索不足。即使某些标准已经被部分 rollout 满足,它们的学习信号也可能在奖励聚合时被淹没。作者将这两类问题分别称为 Unexplored Criteria(UC,未探索标准)和 Suppressed Criteria(SC,被压制标准),并提出 Criterion-Distilled Policy Optimization(CriPO)来同时处理。

核心要点

  • 未探索标准没有优化信号:如果所有采样回答都没有满足某个评分标准,传统强化学习就无法从该标准获得正向反馈。
  • 外部引导会带来错配:一些方法在 rollout 阶段加入 rubric 信息,引导模型生成更符合标准的回答。但训练时依赖外部提示,推理时却没有同样引导,容易造成训练—推理不一致。
  • 被压制标准更隐蔽:论文强调,某些标准其实已经被部分回答满足,但由于总体标量奖励和优势估计为非正,这些局部有用行为没有被强化。作者报告称,训练过程中超过 57% 的样本存在此类问题,平均每个样本有 1.8 个被压制标准。
  • CriPO 使用自蒸馏补信号:针对 UC,方法构造“标准注入”的自教师,并用局部 forward-KL 损失把缺失行为蒸馏回当前策略。针对 SC,则利用反事实自教师定位与标准相关的 token,并把负优势 rollout 中相关 token 的优势修正为正值。

意义与影响

CriPO 的价值在于,它没有把 rubric 作为推理时必须依赖的外部拐杖,而是在训练过程中把标准相关行为内化到策略里。这一点对自回归大模型很重要,因为推理阶段任何早期偏差都可能逐步累积。

从结果看,论文称 CriPO 在医学和科学基准上稳定优于已有 Rubric-based RL 方法,并能用约一半的优化步数达到相近表现。这意味着,对开放式推理、专业问答和复杂评估任务而言,改进奖励信号的“可传递性”可能和设计更复杂的奖励模型同样关键。

更广泛地说,这项工作提醒我们:多标准奖励并不天然等于多维学习。只有当每个标准的有用行为都能被模型接收到、保留下来并在 token 层面产生作用,rubric 才真正变成训练信号,而不是事后评分表。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SAF-OPD:让强化学习与在线蒸馏更稳定地合流
强化学习
cctest.ai
强化学习

SAF-OPD:让强化学习与在线蒸馏更稳定地合流

SAF-OPD 关注一个训练大模型时常见但容易被低估的问题:可验证奖励强化学习与在线蒸馏各有优势,简单相加却可能让训练提前失去探索能力。论文提出的 SAF 通过调节教师信号的强度与时机,在数学推理和代码生成任务中带来更稳定的收益。

阅读全文