返回文章列表
AI 智能体

AgentMercury:把企业业务场景变成可验证的智能体训练世界

阅读约 3 分钟

导语

智能体要学会完成真实工作,不能只依赖一组为评测题目量身定制的模拟任务。现实中的企业流程通常跨越多个系统,涉及客户、订单、库存、权限、支付、工单等相互关联的状态;一个动作还可能改变其他服务中的数据。如何以较低成本生成足够丰富、可执行且能够核验结果的训练环境,正在成为智能体强化学习的重要基础设施问题。

AgentMercury给出的思路,不是先规定“智能体要完成什么题”,而是先搭建一个可以持续运行的业务世界。

核心要点

  • 从任务中心转向世界中心。 框架从高层业务场景出发,实例化实体、服务、工具和状态。任务不再是环境的唯一设计目标,而是从这个世界及其状态变化中自然产生。
  • 强调跨服务不变量。 不同系统之间的业务关系被写成可执行约束。这样,环境不仅能响应工具调用,还能检查一次操作是否破坏了业务逻辑,为训练反馈和结果验证提供基础。
  • 覆盖范围较广。 研究者构建了4783个可执行环境,覆盖14个行业和50个国家,并将其作为强化学习的训练载体。摘要没有展开每类环境的具体配置,但规模与地域跨度显示出框架面向业务多样性的目标。
  • 训练收益不局限于原场景。 在没有针对评测基准专门生成环境的前提下,训练后的策略在EnterpriseOps-GYM上的得分从12.3升至15.7,在AIME26上从45.9升至56.0。摘要还指出,收益涉及推理、编程、科学计算和工具使用等域外能力,但未提供完整实验表格。
  • 环境构建也可被学习。 研究团队使用构建轨迹微调Qwen3.5-35B-A3B,使模型生成可执行世界的成功率提高。现有素材未披露提升幅度,因此不宜进一步量化。

意义与影响

AgentMercury的价值在于重新定义了智能体训练数据的组织方式。传统合成流程往往围绕一个明确任务生成输入、工具和答案,容易得到数量很多却彼此孤立的练习题。以持久化世界为单位,则可以在相同业务背景下派生不同目标、不同初始状态和不同操作路径,更接近企业流程的开放性与长链条特征。

这也为强化学习提供了更清晰的验证接口:奖励不必只来自最终答案,还可以来自状态转移是否有效、跨系统约束是否满足以及操作后世界是否保持一致。若这一机制能够稳定扩展,未来企业智能体的训练或许会从“刷任务”逐渐转向“在业务世界中持续行动”。

不过,现有摘要仍缺少环境生成流程、质量控制、基线设置、训练成本和完整消融实验等关键信息。尤其是域外基准的提升是否主要来自通用工具使用能力,仍需论文正文进一步说明。因此,AgentMercury更适合被看作一种具有潜力的环境工程范式,而不是已经解决真实业务部署问题的完整方案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章