进化策略为何能覆盖更多推理路径?一项对比 GRPO 的研究
导语
在大语言模型推理后训练中,Pass@1 与 Pass@K 往往代表两种不同能力:前者关注模型第一次回答是否正确,后者则考察模型在多次采样中能否找到至少一个正确解。主流的 GRPO 擅长优化前者,但持续强化单一高奖励路径,也可能让模型逐渐失去其他可行的推理方式。
新研究《Understanding Evolution Strategies for LLM Reasoning》将进化策略(Evolution Strategies,ES)与 GRPO 进行系统比较,试图回答一个关键问题:ES 的优势究竟只是节省显存,还是代表一种不同的推理后训练机制?论文给出的答案是后者。
核心发现
- ES 更重视推理覆盖范围。 研究从理论和实验两方面指出,ES 能让模型保留更多不同的解题路径。对于需要多次采样的任务,这种覆盖能力有助于获得更高的 Pass@K。
- 多样性是重要信号。 作者使用“验证器投影后的 Jensen-Shannon 多样性”衡量 ES 种群中候选推理结果的差异。理论分析表明,更高的这种多样性与更好的 Pass@K 表现相关。这里的重点不是单纯生成更多文本,而是保留更多经过任务验证、具有潜在价值的解法。
- GRPO 可能发生熵塌缩。 论文观察到,GRPO 在优化 Pass@1 的过程中会趋向更集中的输出分布。它可能更快锁定当前有效的答案模式,却减少探索其他路径的机会。相比之下,ES 能在提升 Pass@1 的同时取得更高的 Pass@K。
- 两者可以组合。 研究提出先进行 GRPO、再进行 ES 的顺序训练策略,试图结合 GRPO 提升单次正确率的能力与 ES 扩大解空间覆盖的优势。
- 参数漂移不等于功能全面改变。 尽管 ES 训练后整个模型可能出现明显参数变化,但任务性能提升主要来自少量幅度更大的更新。作者将这种现象概括为功能稀疏性:参数层面的广泛移动,并不意味着模型行为在所有方面都发生同等程度的变化。留出任务评估也显示,这种漂移不必然导致灾难性遗忘。
- 模型规模会影响超参数选择。 研究还发现,更大的语言模型可能需要更小的 ES 种群规模,说明种群设计不能简单沿用小模型配置。
意义与影响
这项工作重新定义了 ES 与 GRPO 的关系。ES 并非只是计算资源受限时的“低配版”后训练方法,而是通过维持候选解的多样性,针对推理能力的覆盖范围提供了另一条优化路径。对于数学、代码和其他可验证推理任务,单次命中率固然重要,但模型能否在多次尝试中探索到正确答案,同样决定了系统的实际上限。
研究也提醒开发者,评估推理后训练模型时不能只看 Pass@1。若训练过程过度集中于少数高奖励轨迹,表面上的准确率提升可能伴随推理边界收缩。未来更合理的方案,可能是在训练阶段同时监测输出熵、验证器认可的解法多样性以及 Pass@K,并根据任务需求在 GRPO 与 ES 之间进行组合,而不是将某一种算法视为通用答案。
评论
正在确认登录状态……
正在加载评论……