CompoWorld:让智能体学会跨服务完成复杂工作流
导语
现实中的智能体任务很少只发生在一个应用里。用户可能先从邮件或数据库提取信息,再调用日历、项目管理或自动化工具完成后续操作。如何大规模构造这类跨服务、长链路且可验证的训练环境,是通用智能体训练面临的关键问题。CompoWorld正是针对这一缺口提出的组合式环境扩展框架。
核心方法
CompoWorld的基本思路不是无限复制单一环境,而是先建立一套可复用的服务库,再将服务按依赖关系组合起来。
- 服务化环境:编码智能体根据工具规格生成服务实现,并为服务设计带类型约束的状态和共享接口。经过验证后,这些服务可以作为稳定的环境组件反复使用。
- 覆盖不可实现工具:对于难以可靠编写或复现的工具,系统引入世界模型处理相关交互,减少环境构建对真实外部系统的依赖。
- 依赖图生成任务:随机游走过程在服务之间建立依赖关系,让任务中的信息能够从一个服务流向另一个服务。由此生成的工作流不只是调用多个工具,还要求智能体正确保存、转换并使用中间结果。
- 面向完成度的训练:验证后的轨迹用于监督微调;强化学习阶段则采用Completion-Focused Rubric Reward,在每组采样结果中更加关注通过率较低的评价标准,促使模型补齐任务链条中的薄弱环节。
研究团队构建了448个服务,提供10,130个工具,并使用3K条监督微调轨迹和1K个强化学习任务训练Qwen3.6-35B-A3B。论文摘要显示,该方法在八项基准上的平均成绩较基础模型提升9.17分;在AutomationBench上,训练模型超过了包括Claude Opus 4.6在内的前沿模型,并在对比的35B-A3B智能体模型中排名靠前。
意义与影响
CompoWorld的价值在于把“环境规模”从单个应用的任务数量,扩展到多个服务之间可能形成的组合空间。有限的服务库只要拥有清晰接口和可验证状态,就能生成大量不同的依赖结构,为智能体学习信息传递、工具衔接和长程执行提供更丰富的数据来源。
这一方向也提示,智能体能力提升不一定只依赖更大的模型或更多静态指令数据,训练环境的结构同样重要。与此同时,组合式环境仍受服务实现质量、世界模型准确性和自动验证覆盖范围影响。摘要提供了较好的基准结果,但要判断其在开放互联网、真实权限管理和高风险业务中的可靠性,还需要更多公开细节与独立复现。总体而言,CompoWorld展示了从“单服务任务生成”走向“跨服务工作流生成”的一种可行路径。
评论
正在确认登录状态……
正在加载评论……