RLVR不必只学自己的样本:GRAFT让异构模型交换推理轨迹
导语
在基于可验证奖励的强化学习(RLVR)中,模型通常依靠自己生成答案,再根据答案是否正确获得奖励。以GRPO为代表的方法会将多条回答组成一组,通过组内奖励差异计算优势并更新策略。但有限的rollout预算意味着一个现实问题:某些题目可能一次也没有采到正确答案。对这类“全失败组”而言,奖励无法提供有用的相对信号,采样预算也就被部分浪费。
论文《Learning Beyond What You Sample》提出的GRAFT,试图把模型自身没有采到的经验补进训练过程。它的出发点并不是寻找一个固定的强教师,而是利用异构模型之间的能力互补:一个模型没能解决的题目,另一个模型可能已经生成了可验证的正确轨迹。
核心要点
- 用同伴轨迹替换全失败组:当某个模型在一组题目上的采样全部失败时,GRAFT可以引入同伴模型在对应题目上生成的轨迹,避免该组完全没有学习信号。
- 不只传递成功答案:方法同时交换成功和失败的响应,并使用生成这些响应的同伴模型计算优势。这样,训练信号不局限于“抄一个正确答案”,也保留了组内比较的信息。
- 显式处理离策略偏差:同伴模型与当前训练模型的策略分布不同,直接使用对方轨迹可能导致更新不稳定。GRAFT通过序列级兼容性权重筛选或调节轨迹影响,并在令牌级裁剪重要性比率,限制跨模型分布差异带来的风险。
- 支持非同步使用:实验还表明,预先存储的同伴轨迹可以保留相当一部分收益,因此模型不一定必须同时在线协同训练。
实验与意义
作者在三组异构模型组合和五个数学推理基准上,将GRAFT与使用相同单模型rollout预算的GRPO比较。结果显示,两个模型都能从交换中获益,平均提升为2.1个百分点,模型级平均性能最高提升4.5个百分点;使用存储轨迹时,相对GRPO的平均提升仍达到1.8个百分点。这里的关键不是简单增加采样次数,而是重新利用已经由其他模型完成的探索。
这项工作对RLVR的启发在于,训练数据的边界不必等同于单个模型的采样边界。多个能力结构不同的模型可以构成一个相互补充的经验池,而离策略校正则是让这种共享可控的关键。与此同时,GRAFT并不意味着任意外部轨迹都适合直接使用:模型差异、轨迹兼容性以及重要性比率控制仍会决定收益和稳定性。总体来看,该方法为降低RLVR中失败采样的浪费、构建可复用的轨迹缓存,以及探索无固定教师的协同强化学习提供了一个具体方向。
评论
正在确认登录状态……
正在加载评论……