BPO:用贝尔曼方程简化大模型可验证奖励训练
导语
大语言模型的强化学习训练,正在从人工偏好反馈扩展到可验证奖励(RLVR)。在数学推理等任务中,模型生成完整答案后即可根据结果判断对错,但如何把一个终止奖励稳定地传递到漫长的 token 序列,仍是策略优化中的关键问题。Bellman Policy Optimization(BPO)提出了一条不依赖显式 critic 的路径:借助策略镜像下降(Policy Mirror Descent,PMD)与贝尔曼方程,将原本需要处理中间状态价值的目标改写成轨迹级形式。
核心要点
- 不使用显式 critic。 传统方法通常需要估计中间状态的价值或优势,以指导每一步生成。BPO 针对自回归生成和终止奖励设置,直接在完整轨迹层面构造训练目标,从而绕开中间状态价值估计。
- 理论目标来自 PMD。 BPO 并非简单改变损失函数,而是先从 PMD 出发,再利用贝尔曼方程重新组织目标。论文证明,改写后的轨迹级目标与原始 PMD 目标拥有相同的唯一最优解,因此理论上并未改变优化所指向的解。
- 实践版本修正分布不匹配。 真实训练中,采样策略与当前策略之间存在差异。BPO 对轨迹级目标进行近似,并将 GRPO 中使用的重要性采样比替换为一种经过平滑的互补 token 概率比,用于进行 mismatch correction。
- 面向 RLVR 推理任务。 论文在数学推理基准上进行了实验,结果显示 BPO 具备有效性。不过,素材未披露具体基准、模型规模或性能增幅,因此不宜据此判断其相对其他方法的全面优势。
意义与影响
BPO 的价值首先在于重新审视 critic-free 强化学习的实现方式。对于只有最终对错信号的生成任务,显式学习每个前缀状态的价值函数可能带来额外复杂度与估计误差。BPO 通过贝尔曼关系,把信用分配问题转化为对完整生成轨迹及其 token 概率的处理,为这类任务提供了更直接的目标构造思路。
同时,BPO 也提示,策略优化中的重要性权重并不只有传统形式。平滑的互补概率比试图在校正行为策略与当前策略差异的同时控制数值波动,这种设计可能更适合长序列生成场景。素材中的讨论还指出,BPO 与另一项工作在核心梯度形式上存在联系,但二者对 KL 项的近似方式不同:BPO 使用二元近似和加性平滑。该观察说明,不同理论推导可能最终导向相近的优化信号。
总体而言,BPO 为 RLVR 中的无 critic 策略优化提供了具有理论依据的替代表述。它是否能在更多任务、模型规模和训练设置下稳定胜出,仍需要更完整的实验数据与后续研究验证。
评论
正在确认登录状态……
正在加载评论……