返回文章列表
强化学习

让事后经验指导事前判断:SRD为RLVR补上被浪费的学习信号

阅读约 3 分钟

导语

强化学习通常在智能体完成交互后,根据结果奖励判断一次行动是否值得重复。但对使用群组相对目标的RLVR、GRPO等方法而言,如果同一组采样轨迹全部成功或全部失败,组内就没有可比较的奖励差异,更新信号随之消失。问题在于:这些轨迹并非没有价值,失败过程可能暴露工具调用错误,成功过程也可能包含任务所需的关键知识。

Self-Retrospection Distillation(SRD)针对的正是这类“奖励没有区分度,但轨迹仍有信息”的场景。它提出一种被称为“前瞻学习”的思路:让事后经验去监督行动前的判断。

核心方法

  • 在开始交互前,策略根据当前可见信息预测自己可能遇到的困难、陷阱或需要掌握的知识。
  • 轨迹完成后,一个停止梯度的同策略副本读取完整轨迹,评估哪些前瞻预测被现实印证,哪些内容需要调整。
  • SRD通过辅助蒸馏损失,对齐行动前预测与获得完整上下文后的逐词分布。
  • 前瞻结果只在训练阶段作为目标,不要求模型在推理时额外生成一段预测,因此可以作为GRPO、OPSD或RLSD的轻量插件。

这种设计并不是简单地把最终奖励换成另一种分数,而是利用轨迹本身提供的“特权信息”改善信用分配。即使所有样本都拿到相同奖励,模型仍有机会学习哪些做法容易导致失败,以及执行任务前应当注意什么。

实验信号

根据作者提供的信息,SRD在数学、代码、搜索、ALFWorld和WebShop等10项工具集成或长程任务上进行了评估,并与GRPO、OPSD和RLSD结合。实验显示,它在不同训练框架中都能带来增益,最高提升达到24.2个百分点;当奖励对比稀缺时,效果尤其明显。不同模型规模下,奖励完全一致的采样组占比为37%至98%。在2B设置中,98%的组属于全失败,单独GRPO训练后的成功率为0.0%,加入SRD后则达到60.6%。

作者还指出,SRD能够改善纯自蒸馏训练的稳定性:在9B模型的部分任务上,OPSD表现低于未训练模型,而结合SRD后重新超过未训练基线。其优势也在未见过的格式和更长的工具调用链上得到保留。

意义与局限

SRD的重要性在于重新定义了失败样本的价值。传统结果导向的强化学习可能把“所有人都失败”的群组视为无用数据,而SRD尝试从失败路径中提炼可用于下一次行动的预警信息。这为长程智能体的训练提供了另一条思路:奖励负责判断结果,回顾负责解释过程,前瞻则把解释转化为行动前的准备。

不过,现有材料主要给出了方法概述和作者报告的实验结果,尚不足以单独判断其在更多环境、不同提示设计或更大模型上的普适性。前瞻目标的质量、停止梯度副本带来的计算开销,以及错误回顾是否会被模型进一步放大,仍值得结合完整论文和代码验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
NeMo-DCR:用增量同步把万亿参数智能体强化学习权重更新提速约35倍
强化学习
cctest.ai
强化学习

NeMo-DCR:用增量同步把万亿参数智能体强化学习权重更新提速约35倍

NeMo-DCR 面向训练集群与 rollout 集群之间的权重同步,只传输发生变化的参数,并保证接收端与完整检查点加载结果逐位一致。在 1 万亿参数、3% 元素变化的测试中,同步时间从 87.5 分钟降至 2.5 分钟。

阅读全文