返回文章列表
模型评测

ArrivalBench:一次跑通的智能体数据管道,可能经不起时间考验

阅读约 3 分钟

导语

让智能体写一个能运行的数据管道,已经不算最难的评估任务。更棘手的问题是:当数据不是一次性整齐到达,而是迟到、重复、乱序,甚至经历重试时,管道还能否持续产出正确结果?arXiv 论文《ArrivalBench》给出的答案是,传统的一次性测试很可能过于乐观。

核心要点

  • 从固定快照转向事件重放。 传统基准通常把一批数据交给管道运行一次,再检查输出。ArrivalBench会保留智能体生成的管道,并在可重放的对抗性交付计划下重新执行,覆盖迟到、重复、乱序和重试记录。
  • 用批处理结果作为判定依据。 测试并非只判断程序是否报错,而是将流式处理后的最终状态,与完整日志一次性批量重算的结果进行比较。这样,程序崩溃和生成错误表格会被明确区分。
  • 单次通过率与真实可靠性存在明显落差。 在40个任务中,研究者复现单次执行评分后发现,11个模型生成的管道有86%至100%会被认证;但对这些同一批产物进行重放时,有7.0%至79.2%被发现结果静默错误。
  • 修复过程没有消除问题。 针对快照测试进行过修复的管道,重放失败的比例与首次通过的管道大致相近。这说明缺陷并非主要来自修复轮次,而是来自评估环境没有暴露时间维度。
  • 幂等性是更常见的薄弱点。 在所有模型中,涉及重复处理的幂等性风险比单纯的顺序风险更容易导致失败。

意义与影响

这项工作提醒人们,数据智能体的“正确”不能只理解为某个输入样例上的函数输出正确。对于持续接收事件的系统,状态如何随时间演化同样是规格的一部分。一个管道即使没有崩溃,也可能因为重复写入、覆盖旧值或错误处理迟到事件,留下监控系统难以察觉的错误结果。

ArrivalBench还揭示了干预措施的另一面。对某个模型加入风险提示后,静默失败率从48.2%降至10.5%,但崩溃率从9.0%升至37.0%;将两类失败合并计算,整体失败率只从51.0%降到44.0%。因此,评估智能体时若只看“是否报错”或只看“结果是否错误”,都可能误读干预效果。研究报告称,11个实验分支均独立重跑,指标变化最多为5.9个百分点。

对开发者而言,下一步重点不只是让智能体生成能跑的代码,还应要求其明确幂等性、事件顺序、重试语义和最终一致性。对基准设计者而言,时间、交付顺序与状态重算应成为数据工作评估的常规组成部分,而不是额外的压力测试。

arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
从模型行为追溯数据来源:合成预训练让表格模型归因变得可验证
模型评测
cctest.ai
模型评测

从模型行为追溯数据来源:合成预训练让表格模型归因变得可验证

一项研究利用带有完整来源链的合成任务,检验哪些预训练数据真正影响表格基础模型的表现。结果显示,行为归因能够指导有效的数据移除,但“来源相似”与“因果贡献”并不总是一致。

阅读全文