返回文章列表
强化学习

Muon 何时能帮到智能体强化学习?关键在优化器、优势估计与学习率的组合

阅读约 2 分钟

导语

Muon 近来常被讨论为 AdamW 的潜在替代方案,尤其是在大规模预训练中表现出竞争力。但对强化学习后训练而言,问题并不只是“哪个优化器更强”:智能体任务往往奖励稀疏、轨迹较长,训练成败还取决于信用分配、优势估计和学习率等因素。这篇论文《When Does Muon Help Agentic Reinforcement Learning?》正是围绕这个问题展开:Muon 到底在什么条件下能帮到智能体强化学习?

研究者选择了 ALFWorld 这一长程、稀疏奖励的智能体环境,并使用 Qwen2.5-0.5B-Instruct 作为基础模型,将 vanilla Muon 与 AdamW 做匹配的单随机种子比较。需要注意的是,论文并没有宣称 Muon 全面取代 AdamW,而是强调其效果与训练配方高度耦合。

核心要点

  • 在 GiGPO 设置下,Muon 带来明显提升。 当研究者只把 Muon 应用于隐藏层权重矩阵时,最终窗口验证成功率从 AdamW 的 0.290 提升到 0.546,相对提升约 88%。作为对照,高学习率 AdamW 在更新后没有保留成功表现,说明简单提高 AdamW 学习率不能复现这一收益。

  • 收益取决于优势估计方法。 在 3e-5 学习率下,Muon 将 GRPO 的最终窗口成功率从 0.161 提升到 0.268;但在 GraphGPO 上,由于后期表现接近饱和,两者差距缩小。这提示优化器效果不能脱离优势估计器单独评估。

  • 学习率是关键变量。 在 1e-5 下,GraphGPO 搭配 Muon 达到 0.901 的成功率,并将归一化验证 AUC 从 0.399 提升到 0.556。同时,它达到 0.5 和 0.75 成功率阈值的时间分别提前了 30 次和 60 次更新,体现出更快的学习效率。

意义与影响

这项工作的重要性在于,它把优化器选择重新放回智能体 RL 的系统设计中讨论。过去在 RL 后训练里,研究焦点更多集中在奖励建模、采样策略和优势估计上;而这篇论文显示,优化器本身也可能影响长程稀疏奖励任务中的学习稳定性和样本效率。

不过,结论仍需谨慎看待。论文明确指出,目前实验是单随机种子比较,且主要集中在 ALFWorld 与 Qwen2.5-0.5B-Instruct 组合上。Muon 是否能迁移到更多任务、更大模型或不同智能体环境,还需要多种子、跨任务验证。

总体来看,Muon 的价值不在于提供一个万能替代品,而在于提示研究者:在智能体强化学习中,策略优化器、优势估计器和学习率应当被联合调参和评估。对于追求更稳定、更高效 RL 后训练的团队来说,这是一条值得继续验证的方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
CPO:用“正确性感知”替代单纯熵信号的 RLVR 新思路
强化学习
cctest.ai
强化学习

CPO:用“正确性感知”替代单纯熵信号的 RLVR 新思路

这篇论文提出 Contrastive Policy Optimization(CPO),尝试解决 RLVR 中把熵当作优势塑形信号时无法区分“有益不确定性”和“有害混乱”的问题。它通过比较参考引导生成与普通生成的 token 级分布差异,为训练提供更接近正确性的信号。

阅读全文