别再平均撒网:NGU如何让LLM强化学习真正攻克难题
导语
强化学习通常被视为提升大语言模型推理能力的重要手段,但训练效果并不总是平均分布在所有问题上。论文《Learning to Solve Hard Problems in RL for LLMs by Never Giving Up》观察到,RL对模型已经比较擅长的简单题提升更明显,对真正困难的问题帮助却相对有限。
作者把这种现象称为“LLM强化学习中的马太效应”。它借用了“富者愈富”的概念:模型越容易解决的问题,越快获得正确反馈,也越容易在训练中继续得到强化;而难题因为成功样本稀少,反而难以获得足够的学习信号。
核心要点
- 问题不只是难题需要更多算力。 论文认为,现有RL流程本身也在放大差距。许多训练方法会对每道题使用相近数量的采样,即使模型很快已经解决了简单题,仍可能继续为其生成大量样本。
- NGU把采样变成自适应过程。 Never Give Up的基本规则很直接:只要一个问题还没有得到正确答案,就继续为它生成样本;一旦找到正确解,就停止在该问题上投入同等规模的计算。
- 异步执行是关键。 不同题目可以按照各自的解决进度推进。简单题较早退出,难题则持续获得尝试机会,从而实现计算预算的动态再分配。
- 方法还需关注离策略稳定性。 研究进一步讨论了NGU在异步、非完全同步训练环境中的设计选择,并总结了相关实践建议,而不是把自适应采样简单理解为无限增加生成次数。
实验与意义
在Deepscaler数学基准上,NGU在单位计算成本下的表现更好,且优势在更困难的问题上更加明显。对Manufactoria这类编程任务,标准GRPO配合逐测试奖励时,可能停留在只通过部分简单测试的状态:平均奖励有所提高,却没有真正完成问题。NGU则能够反复针对尚未通过的测试改进,逐步处理更难的测试,直到学会完整解决编程问题。
这项工作的价值不在于提出一个复杂的新算法,而在于重新审视RL训练中的“计算分配”问题。对LLM后训练而言,正确答案的数量并不是唯一指标;哪些题目获得了尝试机会、哪些题目过早被视为“足够好”,同样会塑造最终能力。如果这一思路在更多任务上成立,未来的RL系统可能需要从固定批次和固定采样配额,转向更像资源调度器的训练机制:尽快筛出已掌握样本,把剩余预算留给仍未解决的长尾难题。
当然,素材只展示了数学和编程场景中的结果,NGU对不同奖励设计、任务分布和训练规模的适用性仍需进一步验证。它更像是一条清晰的工程与研究方向:让模型在遇到难题时,不是被平均采样策略提前放弃,而是获得继续尝试的机会。
评论
正在确认登录状态……
正在加载评论……