CriPO:用自蒸馏补上 Rubric 强化学习的“缺失信号”
导语
在开放式任务中,用单一奖励去评价大模型回答往往过于粗糙。因此,Rubric-based RL(基于评分细则的强化学习)开始受到关注:它把任务拆成多个可检查的标准,让模型不仅追求“总体看起来不错”,也尽量覆盖关键要求。
这篇论文指出,当前 Rubric-based RL 的难点不只是探索不足。即使某些标准已经被部分 rollout 满足,它们的学习信号也可能在奖励聚合时被淹没。作者将这两类问题分别称为 Unexplored Criteria(UC,未探索标准)和 Suppressed Criteria(SC,被压制标准),并提出 Criterion-Distilled Policy Optimization(CriPO)来同时处理。
核心要点
- 未探索标准没有优化信号:如果所有采样回答都没有满足某个评分标准,传统强化学习就无法从该标准获得正向反馈。
- 外部引导会带来错配:一些方法在 rollout 阶段加入 rubric 信息,引导模型生成更符合标准的回答。但训练时依赖外部提示,推理时却没有同样引导,容易造成训练—推理不一致。
- 被压制标准更隐蔽:论文强调,某些标准其实已经被部分回答满足,但由于总体标量奖励和优势估计为非正,这些局部有用行为没有被强化。作者报告称,训练过程中超过 57% 的样本存在此类问题,平均每个样本有 1.8 个被压制标准。
- CriPO 使用自蒸馏补信号:针对 UC,方法构造“标准注入”的自教师,并用局部 forward-KL 损失把缺失行为蒸馏回当前策略。针对 SC,则利用反事实自教师定位与标准相关的 token,并把负优势 rollout 中相关 token 的优势修正为正值。
意义与影响
CriPO 的价值在于,它没有把 rubric 作为推理时必须依赖的外部拐杖,而是在训练过程中把标准相关行为内化到策略里。这一点对自回归大模型很重要,因为推理阶段任何早期偏差都可能逐步累积。
从结果看,论文称 CriPO 在医学和科学基准上稳定优于已有 Rubric-based RL 方法,并能用约一半的优化步数达到相近表现。这意味着,对开放式推理、专业问答和复杂评估任务而言,改进奖励信号的“可传递性”可能和设计更复杂的奖励模型同样关键。
更广泛地说,这项工作提醒我们:多标准奖励并不天然等于多维学习。只有当每个标准的有用行为都能被模型接收到、保留下来并在 token 层面产生作用,rubric 才真正变成训练信号,而不是事后评分表。
评论
正在确认登录状态……
正在加载评论……