返回文章列表
强化学习

FlowBalance:让推理模型用验证器校准自我改进

阅读约 3 分钟

导语

推理模型能够从自己生成的答案中继续学习,但这种“自我改进”并不天然可靠。终局验证器通常能判断答案是否正确,却只在轨迹末端提供稀疏信号;同一个模型产生的逐步反馈则更加密集,但可能把“看起来合理”的错误推理误认为好推理。FlowBalance试图在两者之间建立更稳健的协调机制。

核心方法

FlowBalance面向在线策略(on-policy)推理经验,学习的不是单个词的模仿目标,而是完整回答在训练分布中的归一化权重。其流程可以概括为:

  • 先生成轨迹:模型根据当前策略产生一组完整推理回答,并由终局验证器给出结果。
  • 计算自我引导分数:训练时冻结的同一策略视图利用特权上下文,计算每个令牌的对数概率增益,再聚合成整条轨迹的自我反馈分数。
  • 用组优势校准反馈:模型不再无条件相信自己的“教师信号”。对于相对结果更好的轨迹,保留自我引导;对于负优势、被验证器判定为不理想的轨迹,则反转这类引导;当一组采样没有形成结果偏好时,关闭自我引导。
  • 在轨迹层面拟合目标:经过校准后的分数被转化为能量,对参考策略进行指数重加权。随后,方法通过带有剖面化处理的轨迹平衡,在每个 rollout 组内估计归一化项并拟合目标分布。

这一路径的关键,是把稠密反馈置于验证器的结果信号之下,而不是让模型自身的判断直接主导训练。

理论与实验观察

论文分析了该目标的若干性质,包括组内对比关系的保持、以反向KL为基础的最小改动解释,以及验证器对目标奖励的单调控制。更重要的是,当被拒绝的回答获得了错误的正向自我反馈时,方法可以通过优势校准进行精确修正,从机制上降低“错误自信”被放大的风险。

在数学推理实验中,作者报告FlowBalance在Qwen3-4B和Qwen3-8B上相较FlowRL取得更好的平均表现,同时改善训练速度与稳定性。与直接使用OPSD相比,它避免了回答长度塌缩;在受控的AIME24诊断中,还表现出更高的正确策略多样性。素材没有提供具体分数,因此这些结果更适合作为方向性结论,而非跨方法的定量排名。

意义与限制

FlowBalance的价值在于提供了一种较清晰的信用分配思路:验证器负责决定自我反馈应该被信任、削弱还是关闭,模型的密集信号则用于在这一约束下提供更细粒度的学习方向。这对数学题等拥有可靠终局验证器的任务尤其有吸引力,也说明推理训练未必需要在稀疏奖励与逐词监督之间二选一。

不过,该框架仍依赖有效的终局验证器、合理的组内比较和额外的特权上下文。在开放式生成任务中,答案质量往往难以被精确验证,方法的收益能否延伸到这些场景,仍需进一步研究。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章