返回文章列表
强化学习

CPO:用“正确性感知”替代单纯熵信号的 RLVR 新思路

阅读约 3 分钟

导语

在大模型强化学习训练中,RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)是一条重要路线:模型输出是否正确,可以由规则、判题器或明确答案进行验证。但即使最终奖励可验证,训练过程仍需要把奖励信号更细地分配到生成序列中。过去常见做法是利用熵进行优势塑形,希望用模型的不确定性来鼓励探索。然而,熵本身只描述“分布有多分散”,并不直接说明模型是在进行有价值的探索,还是陷入了无意义的困惑。

论文《Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization》提出的 CPO(Contrastive Policy Optimization)正是针对这一盲点:与其把所有不确定性都视作同一种信号,不如比较两种生成分布之间的差异,从中提取更接近“正确性”的 token 级线索。

核心要点

  • 问题背景:熵不是正确性的可靠代理
    在 RLVR 中,熵常被用于优势塑形,但它无法区分“模型在多个合理路径之间探索”和“模型对下一步完全混乱”。这会限制熵信号在推理、数学或可验证任务中的作用。

  • CPO 的关键:对比两类生成分布
    CPO 使用参考引导生成分布与普通生成分布之间的 token 级 contrastive disagreement。简单理解,就是观察“有参考信息引导时模型倾向于生成什么”与“模型自然生成时倾向于生成什么”之间的差别。论文认为,这种差异能作为 correctness-aware 的优势塑形信号。

  • 从 token 层面刻画正确性
    与只在最终答案上给奖励不同,CPO 希望把正确性信息更细粒度地传导到生成过程。论文给出了理论解释,并通过实验表明,这类分歧可以较可靠地指示 token 级正确性。

  • 与蒸馏方法的关系
    作者进一步指出,On-policy Distillation 可以看作 CPO 的一个特例:当后验分布由外部教师模型实例化时,蒸馏就落入 CPO 框架之中。这为理解强化学习与蒸馏之间的联系提供了统一视角。

  • 缓解零优势问题
    CPO 还被用于解决零优势问题。对于 RLVR 训练来说,当奖励信号过于稀疏或样本之间难以形成有效差异时,优势估计可能失效;CPO 通过引入分布层面的对比信号,为优化提供了额外结构。

意义与影响

这项工作的价值在于,它没有停留在“增加探索”这一宽泛目标上,而是试图回答一个更关键的问题:哪些探索更可能通向正确答案?如果 token 级分布分歧确实能稳定反映正确性,那么 RLVR 的训练信号就可以从最终结果进一步下沉到生成过程本身。

论文实验覆盖了域内与域外基准,结果显示 CPO 相比基于熵的 RLVR 方法有明显优势,并保持较强泛化能力。更有意思的是,作者分析认为正确与错误响应分别天然支持探索与利用,而最佳效果来自二者之间的平衡。这意味着未来的强化学习训练可能不只是简单奖励正确、惩罚错误,而是更精细地利用不同类型样本在学习动态中的作用。

总体来看,CPO 为 RLVR 提供了一种更“懂正确性”的优势塑形方式,也为熵正则、策略蒸馏和可验证奖励训练之间建立了新的解释框架。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章