返回文章列表
强化学习

LLM强化学习为何会出现训练与推理错配?CIS给出校准方案

阅读约 3 分钟

导语

在带可验证奖励的强化学习(RLVR)中,大语言模型通常先由推理引擎生成回答,再由训练引擎根据奖励计算梯度。理想情况下,两套引擎应当把每个 token 视为来自同一个策略。但在实际系统里,即使模型权重完全相同,硬件、并行方式、数值精度和算子实现等差异,也可能让两者给出不同的 token 概率。这种训练—推理错配会使策略更新偏离原本的目标。

论文《Rethinking Training-Inference Mismatch in LLM Reinforcement Learning》聚焦这一问题,并提出校准重要性采样(Calibrated Importance Sampling,CIS)。它并非简单地把重要性权重限制在一个固定范围内,而是尝试回答:概率差异究竟如何产生,以及截断规则应如何随 token 的置信度变化。

核心要点

  • 错配发生在两套引擎之间。 Rollout 由推理引擎采样,梯度则由训练引擎计算。若两者对同一 token 的概率不同,直接使用重要性采样可能产生极端权重。
  • 用对数几率描述差异。 作者的实证分析表明,训练与推理的差异可以近似表示为对数几率上的加性位移。该位移由 softmax 前的逐 logit 扰动决定,而且其分布与 token 本身的置信度近似无关。
  • 截断应当感知置信度。 CIS在位移空间中对较大的正向位移采用统一阈值,再映射回重要性权重空间。结果是:对于本来就很有把握的 token,权重上限会更严格;对低置信度 token,则保留更多有效更新,减少不必要的截断偏差。
  • 在方差和偏差之间取平衡。 理论结果显示,CIS可以把精确重要性采样中可能无界的二阶矩误差,替换为受常数控制的项;代价是引入与被截断超额相关的偏差。论文还观察到,向上裁剪较小的重要性权重会降低留出准确率,说明并非所有形式的“稳定化”都有益。

实验与意义

作者在三个混合专家模型和五个数学推理基准上,将CIS与多种基线进行比较。按照五个基准的平均结果,CIS在三个模型上都取得了参与评测方法中的最高成绩。诊断实验进一步显示,相比普通的截断重要性采样,CIS在低置信度 token 上施加的截断偏差更小。

这项工作对LLM强化学习系统的启示,不只是提出一个新的权重公式。它指出,训练基础设施中的数值和实现差异,可能通过概率比率被放大,最终影响策略学习。因此,训练框架、推理服务和并行计算栈之间的兼容性,应当成为RLVR系统设计的一部分。CIS提供了一种从 logit 扰动出发的分析视角,也为未来根据模型、硬件或引擎特性自适应校准重要性权重提供了方向。不过,现有结论仍主要来自论文所报告的模型与数学任务,迁移到更广泛任务时还需要进一步验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章