返回文章列表
强化学习

DRACO:用动态评分标准解决长程智能体训练的信用分配难题

阅读约 3 分钟

导语

在有明确程序检查器的任务中,强化学习可以直接根据结果判断策略是否正确。但对多轮工具调用、任务规划和环境交互组成的长程智能体而言,很多任务没有可执行的成功判定器。训练过程通常只能在整条轨迹结束时得到一个分数,这个单一信号很难回答一个关键问题:几十个步骤中,究竟哪些动作值得强化?

来自 IBM 研究团队的 DRACO(Distributing Rubric-based Advantage for Credit Optimization)正是针对这一问题提出。论文关注的是“结果不可见”场景,即训练时没有可用的真实成功信号或程序化验证器。

核心方法

  • 动态生成评分标准:DRACO不会固定使用一套评价维度,而是在训练过程中生成多指标 rubric,使评价内容能够跟随策略能力变化。
  • 先评整条轨迹,再分配信用:一条任务轨迹完成后,系统按照评分标准进行整体评价;随后把与各项标准相关的判断分配给负责对应行为的步骤。
  • 为GRPO提供差异化优势值:相比把同一个标量奖励复制给所有动作,DRACO为不同步骤构造更细粒度的 advantage,让策略更新更聚焦于产生相应结果的行为。
  • 不增加训练型归因模块:信用重新分配采用闭式计算,不需要另行训练一个动作归因模型,因而保持了方法结构的简洁性。

这里的关键并不是把轨迹奖励变成更多数字,而是建立“评价维度—相关步骤”之间的对应关系。这样,最终表现不佳时,训练信号不必平均施加到整段交互上;表现较好的行为也有机会获得更明确的强化。

实验结果与意义

在 AppWorld 上,DRACO 相比基础模型提升 15.9 个百分点,相比使用稀疏真实奖励的 GRPO 仍高出 5.3 个百分点。论文强调,DRACO本身并未使用验证器。在分布外的 Tau-Bench 测试中,即使没有前沿模型评审器,DRACO相对基础模型仍提升 5.3 个百分点,并优于使用真实奖励训练的设置以及其他基于 rubric 的训练方案。

这些结果说明,长程智能体训练的瓶颈未必只是“有没有奖励”,还包括奖励能否被准确地送达导致结果的步骤。动态评分标准为没有程序化检查器的领域提供了一种可扩展思路:用结构化评价补足结果信号,再通过信用分配减少长轨迹中的学习噪声。

当然,方法的效果仍依赖评分标准的质量、评价过程的可靠性,以及系统能否正确识别各项标准对应的步骤。它并没有消除主观评价带来的风险,但通过闭式重分配,把粗粒度轨迹反馈转化为更适合策略优化的训练信号。对于工具使用、客服流程和复杂任务执行等场景,DRACO展示了 rubric-based reward 与细粒度信用分配结合的潜力。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章