返回文章列表
强化学习

SLCA-GRPO:让工具调用智能体获得更准确的强化学习反馈

阅读约 3 分钟

导语

工具调用智能体的输出并不是单一形态:一部分 token 负责生成结构化的函数调用,另一部分 token 则负责向用户解释结果、组织摘要或完成自然语言表达。对于这类混合轨迹,传统基于 GRPO 的强化学习存在一个容易被忽视的问题:它通常从整条轨迹得到一个标量优势值,再把这个信号广播给所有 token。结果是,摘要生成质量带来的噪声可能反过来影响工具选择,工具执行结果也可能干扰语言表达训练。

腾讯团队提出的 SLCA-GRPO,试图从信用分配层面解决这一结构性问题。论文同时构建了 Schema-Guided LLM Simulator(SGLS),用于在不依赖高成本真实 API 的情况下开展规模化探索和训练。

核心方法

  • 按结构片段分配优势:Segment-Locked Credit Assignment(SLCA)在同一组 rollout 内,分别估计工具调用片段和总结片段的优势,而不是为整条轨迹使用一个统一数值。
  • 隔离不同奖励来源:结合 Hierarchical Rewards(HierR),执行奖励主要传递给工具 token,偏好奖励则传递给总结 token,从而减少跨片段的优势污染。
  • 不增加中间状态采样成本:该方法不要求从中间状态重新进行额外 rollout,仍可沿用现有的组内采样框架。
  • 使用 schema 引导的模拟环境:SGLS 为工具调用提供结构化模拟,帮助训练过程降低真实服务调用成本,并提升探索的可扩展性。

实验观察

素材显示,在 7B 骨干模型上,SLCA-GRPO 收敛更快,并在相同训练预算下超过标准 GRPO、ToolPO 与 RLTR。其领域内评估提升 2.53 个百分点,在 Berkeley Function-Calling Leaderboard(BFCL)上提升 1.36 个百分点,在 τ²-Bench 上提升 9.15 个百分点。补充结果还表明,该方法在三个 Qwen 骨干模型及分布内、分布外工具调用测试中都提升了任务成功率,同时减少了工具调用轮数。

意义与局限

这项工作的价值不只是提出一个新的 GRPO 变体,更在于指出:工具调用智能体的强化学习目标应当尊重输出的结构。工具选择和用户可读总结虽然出现在同一条序列中,却对应不同的决策与评价来源。若将它们混合优化,训练信号就可能产生系统性偏差;将奖励锁定到相应片段,则有望让优化方向更加清晰。

不过,方法效果仍与奖励设计和模拟器质量密切相关。SGLS 能否充分覆盖真实工具环境中的异常情况,以及分段奖励在更复杂、多轮任务中的稳定性,还需要更多实验验证。总体而言,SLCA-GRPO 为降低工具冗余、改善智能体训练效率提供了一条具有针对性的路径。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章