返回文章列表
强化学习

RLSVR:把开放式任务变成可自证的强化学习环境

阅读约 3 分钟

导语

强化学习正在重新塑造大模型训练范式,其中 RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)尤其受到关注。它的优势在于奖励信号明确:数学题答案对不对、代码能不能通过测试,都可以自动判断。但问题也很明显,现实中的很多语言任务并没有唯一标准答案,例如摘要、创意写作、开放问答或风格化生成。过去这类任务往往依赖人工偏好、奖励模型或 LLM 裁判,既有偏差,也有成本,还会受裁判模型能力限制。

这篇论文提出 RLSVR(Reinforcement Learning with Self-Verifiable Rewards),试图把“不可直接验证”的开放式任务,转换成“可以自我验证”的训练环境。

核心要点

  • 从答案验证转向任务转换:RLSVR 并不是为开放式输出强行设计一个主观评分器,而是构造一个代理环境,让任务内部规则和交互结果自动产生奖励。
  • 借鉴自监督学习思想:类似自监督学习通过预训练任务从数据自身获得监督信号,RLSVR 也希望从任务结构中生成可用反馈。
  • SpyRL 是具体实现:作者设计了一个受“谁是卧底”启发的多智能体自博弈环境。多个智能体接收不对称信息,完成同一目标任务,然后投票识别预设的“卧底”。
  • 奖励可验证:由于谁是卧底在环境中是预先确定的,投票是否成功可以被自动判定,因此奖励不需要人工打分或额外 LLM 裁判。
  • 与输出质量相关:如果一个智能体的摘要或创作质量、信息表达方式更能暴露或隐藏身份,就会影响投票结果。这使得游戏结果与语言输出质量形成间接关联。

意义与影响

这项工作的价值在于,它为开放式任务的强化学习训练提供了另一条路线:不是继续扩大人工反馈或训练更强裁判,而是把任务设计成带有可验证结果的环境。若这种思路成立,RLVR 的适用范围就可能从数学、代码等“天然可验证”领域,扩展到摘要、写作等更广泛的语言生成任务。

论文实验覆盖文本摘要、创意写作和数学推理。结果显示,SpyRL 在非可验证任务上超过已有自我改进方法,并在可验证推理任务上也带来一致收益。不过,素材中没有给出具体基准、模型规模或量化数值,因此仍需结合论文全文进一步判断其泛化性和训练成本。

总体来看,RLSVR 的关键启发是:开放式任务未必只能依赖主观评估,也可以通过任务重构获得更稳定、可扩展的奖励信号。这可能成为大模型自我改进研究中的一个重要方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章