返回文章列表
强化学习

SAT:用“陈旧度自适应”信任域稳定异步强化学习

阅读约 3 分钟

导语

异步强化学习正在成为大模型后训练中的重要工程路径:推理引擎负责持续生成 rollout,训练端则独立消费这些数据并更新模型。这样做能提高系统吞吐,但也带来一个难以回避的问题——数据“陈旧”。当 rollout 由较早版本策略生成,而优化器面对的是更新后的策略时,训练目标与采样分布之间会出现错位。

论文《Stale but Stable》提出的 Staleness-Adaptive Trust Region(SAT),正是为这个异步场景设计的稳定化方法。它不是简单否定 PPO clipping,而是指出:PPO 的裁剪更像是对已采样更新方向的局部代理约束,并不能完整限制训练策略与推理策略之间的分歧。尤其当策略延迟、推理引擎排队、MoE 路由差异叠加时,高陈旧度样本可能成为最需要控制、却最难被常规裁剪充分控制的部分。

核心要点

  • 问题定位:异步带来训练-推理不一致。 在有限时域分析视角下,训练策略与生成数据的策略偏离会影响近似误差。异步系统越追求吞吐,policy lag 与工程延迟越容易积累。
  • 方法思路:按陈旧度调整信任域。 SAT 使用 detached sampled log-ratio 作为实用的陈旧度代理,在 batch 内识别高 mismatch 的尾部样本,并通过基于陈旧度的 kernel scaling 调整裁剪行为。
  • 更新方式:只收紧特定端点。 SAT 并非全局缩小 PPO 区间,而是针对符号选择后的 nominal PPO 区间端点进行收缩。这样普通 token 尽量保持原有 PPO 行为,高风险外扩更新则变得更保守。
  • 理论性质:相对 PPO 更悲观。 论文给出局部区间包含与逐点悲观性的证明,用于说明 SAT 如何在异质陈旧度下改变更新几何。
  • 实验环境:面向真实异步 RL 栈。 作者在基于 Qwen3-30B-A3B-Base 的解耦异步 RL 设置中测试,推理侧使用 SGLang,训练侧使用 Megatron。报告中 SAT-GSPO w/ R3 在 AIME24 avg@8 上表现最好,lag 1 达到 35.83,lag 8 达到 34.79;SAT-GSPO 在 lag 1 达到 34.17。

意义与影响

这项工作的价值在于,它把异步 RL 的稳定性问题从“系统延迟”重新表述为“信任域错配”。在大模型 RL 训练中,吞吐提升往往依赖更复杂的推理服务、批处理和并行调度,而这些机制都会让训练数据与当前模型之间产生时间差。SAT 的思路是承认这种时间差不可避免,并把它显式纳入优化约束。

从工程角度看,SAT 的吸引力在于它不要求对所有样本一刀切地保守更新,而是集中处理 batch 中更可能出问题的 mismatch tail。这有助于在稳定性和学习效率之间取得折中。论文还指出,自适应裁剪与 routing replay 是互补稳定器:前者针对不匹配尾部,后者针对路由不一致。

当然,素材中披露的实验仍集中在特定模型和异步 RL 栈上,SAT 是否能在更多任务、不同 MoE 架构和更大规模延迟分布下保持优势,还需要进一步验证。但它提供了一个清晰方向:未来异步强化学习的优化器,可能不再只关心 advantage 与 ratio,也要理解每条样本“来自多久以前”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
GEPO:给混合任务里的大模型强化学习加上“分组熵”调节器
强化学习
cctest.ai
强化学习

GEPO:给混合任务里的大模型强化学习加上“分组熵”调节器

GEPO 是对 GRPO 的轻量改造,核心不是简单压高熵或保低熵,而是按 prompt 分组的熵状态,去做更细粒度的优势项塑形。它试图解决混合任务训练中,不同题型探索需求不一致、导致统一熵控制失灵的问题。

阅读全文