返回文章列表
AI 智能体

不看数据库结构,智能体如何生成可信企业数据?SAP提出STS框架

阅读约 3 分钟

导语

企业AI智能体要真正投入训练和评测,往往需要大量贴近真实业务的数据。但企业系统、数据库结构和业务记录通常受到隐私、合规与商业限制,研究者很难直接获得。合成数据因此成为替代方案,只是传统方法通常在“像不像”和“能不能用”之间难以兼顾:表格生成器可能产生违反业务约束的记录,而按流程编写的生成器又需要针对每个领域进行大量人工设计。

SAP研究团队在论文《Synthesis Through Simulation》中提出了Synthesis Through Simulation(STS),试图换一种方式生成企业数据:不直接读写数据库,也不要求模型事先了解数据库模式,而是让智能体在模拟企业环境中,通过调用带策略约束的API完成操作。

核心方法:让环境定义什么是有效数据

STS的关键变化,是把数据合成看成一系列业务操作,而不是单纯生成一行行表格记录。模拟环境提供创建、查询或更新业务对象所需的API,并在接口层执行权限、状态和业务规则检查。智能体只有完成合法操作,相关数据才会进入环境状态。

这种设计将两个问题分开处理:

  • 结构有效性由环境保证。 数据必须经过与业务系统相同类型的规则校验,因此实体关系、状态转换和操作约束不再完全依赖生成模型自行推断。
  • 分布建模交给智能体。 模型需要探索可用接口和反馈,决定创建哪些对象、采用什么顺序以及如何组合操作,以生成更接近目标业务分布的数据。
  • 减少模式依赖。 Generalist Populator(GP)是STS中的通用填充智能体,不访问数据库schema,而是通过与环境交互来完成数据构造。
  • 便于跨领域扩展。 约束逻辑封装在各个模拟环境中,通用智能体不必为每个行业重新编写一套数据生成程序。

实验结果说明了什么

论文在十个模拟企业环境中评估GP。研究者报告的结果显示,GP在不获取数据库模式的情况下,平均边际保真度达到0.88,所有环境的约束满足率为100%。这里的保真度指标关注生成数据在边际分布上的接近程度,而约束满足率则反映数据是否符合环境规定的有效性条件。

对比结果也体现了STS的适用边界。统计型合成器在十个环境中的七个环境里因缺少必要种子数据而无法使用。另一方面,即使给予数据库模式,另一类智能体在航空环境的紧密耦合工作流中仍有82%的轨迹失败,说明“知道表结构”并不等于“理解业务流程”。在复杂企业系统中,操作顺序、状态依赖和隐含规则可能比字段名称更关键。

意义与待观察问题

STS的价值不只是生成更多数据,而是把企业数据合成从静态表格问题转化为可交互的系统模拟问题。对于智能体训练和评测,这种方式有望提供更接近真实工具调用场景的轨迹,同时避免直接暴露企业数据库及真实业务记录。

不过,STS的效果仍取决于模拟环境本身。如果环境没有覆盖关键业务规则,或其操作分布与真实系统存在偏差,生成数据即使在环境内部完全有效,也未必代表真实企业世界。此外,智能体探索复杂工作流的成本、API反馈设计和分布保真度评估,仍是落地时需要持续验证的问题。

论文作者已开源完整框架、十个环境及生成数据。它为研究者提供了一个可复现实验基础,也把企业智能体研究的重点进一步推向“如何在受控环境中模拟真实系统行为”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章