返回文章列表
强化学习

GEPO:给混合任务里的大模型强化学习加上“分组熵”调节器

阅读约 3 分钟

导语

在大模型对齐训练里,强化学习常常要同时处理多种任务:有的题目需要大胆探索,有的题目更适合稳定收敛。问题在于,同一个策略面对这些混合任务时,并不会自然地表现出统一的“探索强度”。这就让单一的全局熵控制显得不够灵活。Group Entropy-Controlled Policy Optimization(GEPO)正是为了解决这个矛盾而提出的。

这项工作在说什么

GEPO 可以看作对 GRPO 的一次轻量升级。它不额外引入复杂模块,而是直接利用现有分组采样中的信息,估计每个 prompt group 的熵,再据此调整优势信号的形状。

核心思路可以概括为三点:

  • 按组看熵,而不是一刀切:不同任务组可能天然处在不同熵区间,统一阈值容易失配。
  • 非对称地改写优势项:低熵组里,正优势会被适度削弱,避免模型过早“吃死”某类模式;高熵组里,负优势则被保留更多,防止探索被过度压制。
  • 阈值来自历史统计:不是临时拍脑袋设定,而是利用历史熵分布自适应更新,让控制策略更稳。

为什么 GRPO 会遇到麻烦

GRPO 依赖归一化优势来稳定训练,但当训练数据来自异质任务混合时,优势信号会带上熵相关偏差。简单说,同样是“好答案”或“差答案”,放在高熵组和低熵组里,统计含义可能并不等价。这样一来,跨 prompt group 的优势就不再完全可比,训练过程也容易偏向某些任务状态。

GEPO 的实际价值

从素材描述看,GEPO 的价值不在于引入全新范式,而在于把“熵控制”从粗粒度做细:

  1. 更适合混合任务训练,尤其是数学、物理、科学、代码生成和指令跟随这类目标并存的场景。
  2. 更好维持探索-利用平衡,避免某些任务组过早收缩,也避免另一些任务组探索不足。
  3. 实现成本低,因为它建立在已有分组样本之上,对现有 GRPO 框架侵入性较小。
  4. 跨任务表现更均衡,材料中提到它在两个基础模型、十三个基准上相较 GRPO 和近期熵控制方法更稳定。

可能的影响

这类方法的意义在于,它提醒研究者:大模型 RL 训练里的“一个策略”并不等于“一个统一统计环境”。当任务混合程度越来越高时,控制信号也需要更懂任务分布本身。GEPO 代表的是一种更细腻的训练调节思路——不只看奖励高低,还要看当前组到底有多“保守”或多“发散”。

对于后续工作来说,组级熵控制也许会成为混合任务对齐的一种基础组件,而不仅仅是 GRPO 的补丁。

来源链接:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章