返回文章列表
模型评测

Argo-Bench:把数据智能体放进企业级工作流里考

阅读约 3 分钟

导语

企业里的数据智能体,真正要解决的通常不是“把一句话翻译成 SQL”,而是从分散、复杂且带有业务语义的数据中还原事实,进行分析,最后为企业采取行动。Argo-Bench 正是针对这一完整链路设计的评测框架。

从文本到 SQL,走向数据驱动决策

传统 text-to-SQL 基准主要关注查询语句是否正确,且部分研究已经发现,这类基准的标准答案本身可能存在错误。更重要的是,企业数据工作往往跨越多个主题域和大量表格,最终目标也不是返回一个数字,而是支持财务、人力、风控或运营决策。

Argo-Bench 以纽约市外卖平台为背景,结合公开数据、同行评审行业研究和监管文件,构建了一个具有真实业务规模的模拟环境。其数据仓库包含 235 张表和 75 亿行数据,模拟平台在 2024 年处理的 8100 万笔订单,并纳入经济关系、欺诈模式以及市场激励机制等因素。数据仓库不会直接暴露模拟器中的真实状态,智能体必须通过表之间的关系和可用字段重新拼出所需事实。

核心要点

  • 评测对象更完整:任务覆盖数据探索、统计分析、预测、欺诈防控等企业场景,而非单一查询生成。
  • 需要跨表重建事实:智能体要在大规模 ERP 风格模式中定位信息、理解字段含义并完成关联。
  • 结果由行动后果评分:智能体可以执行封禁欺诈账户、分配骑手激励预算、发放欠薪等操作,评分取决于这些行为在模拟世界中的后果。
  • 每项任务都有可执行参考方案:这为判断任务是否可解提供了依据,也避免把失败简单归因于数据不可用。
  • 当前模型仍不稳定:在 14 个前沿模型和开放权重模型的测试中,最强模型获得 95 分或更高分的任务比例只有 34.8%。

意义与影响

Argo-Bench 的价值在于把“会查数据”和“会做业务决策”区分开来。一个模型即使能生成语法正确的查询,也可能因为漏掉关键表、误读业务口径,或没有评估行动的副作用而做出错误决定。将最终行为置于可执行模拟器中评分,能够更接近企业真正关心的结果:损失是否减少、资源是否合理分配、相关人员是否得到正确补偿。

这类基准也提示,未来的数据智能体需要的不只是更长上下文或更强 SQL 能力,还包括模式理解、统计推理、因果意识、行动规划和结果核验。与此同时,模拟环境与真实企业之间仍有距离,基准能否覆盖更多行业、是否能代表现实数据质量和组织流程,也将影响其长期参考价值。就目前公开结果而言,Argo-Bench 更像是一项压力测试:它说明让模型在企业数据上完成可靠闭环,仍远比生成一条看似正确的查询困难。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
OpenTumorBoard:让大模型接受真实肿瘤多学科讨论考验
模型评测
cctest.ai
模型评测

OpenTumorBoard:让大模型接受真实肿瘤多学科讨论考验

OpenTumorBoard从219场公开肿瘤委员会会议中整理出611个病例和近两万轮讨论,为评估模型参与复杂、多专家协作式临床决策提供了新基准。结果显示,即使是前沿通用模型和医疗模型,在复现专家回答与委员会结论方面仍有明显差距。

阅读全文
CCTest · Blog
PhysVista:用“感知—推理—评估”闭环检验 VLM 的物理智能
模型评测
cctest.ai
模型评测

PhysVista:用“感知—推理—评估”闭环检验 VLM 的物理智能

PhysVista 提出一个面向视觉语言模型的物理智能评测框架,将物理状态感知、动力学推理与物理合理性判断纳入同一认知闭环。基准同时覆盖真实视频与 AI 生成视频,用于检验模型是否真正理解动态世界,而不只是识别画面内容。

阅读全文