返回文章列表
模型评测

长程智能体失败不只要看结果,更要找到谁在何时犯错

阅读约 3 分钟

导语

当一个长程智能体最终没有完成任务时,常规评测通常只能给出“成功”或“失败”。但对开发者来说,真正需要回答的是:错误由哪个角色或环节负责?最早改变后续轨迹的决定性失误发生在第几步?如果只能看到最终结果,调试人员往往必须逐步检查数百条操作记录,才能从一连串后果中倒推出最初的原因。

LongRCA Bench 测什么

LongRCA Bench 正是针对这一问题提出的基准。它包含来自五个领域的 1140 条真实失败轨迹,不依赖人为注入错误;单条轨迹的中位长度达到 145 步。数据集为两个相关但不同的目标提供了独立人工标注:

  • 责任角色识别:判断哪一个参与执行的角色、模块或环节应对失败承担主要责任。
  • 最早决定性根因定位:在完整轨迹中找出最早导致后续失败、且具有决定性影响的步骤。

这一区分很重要。一个智能体可能在早期接受了错误指令,之后多个步骤只是沿着错误方向继续执行;也可能早期出现了异常,但真正造成任务失败的是后续某次关键操作。把“谁负责”和“哪一步是根因”合并成单一指标,容易掩盖两类诊断能力之间的差异。

方法与结果

论文同时提出 Root-Cause Trajectory Attribution(RCTA)。这是一种免训练方法:先利用轨迹分段摘要检索潜在错误步骤,再沿轨迹回溯,将候选错误与此前可获得的交接指令联系起来。换言之,RCTA 并不重新训练一个专门的诊断模型,而是尝试借助摘要和角色交接信息缩小长轨迹中的搜索范围。

在相同骨干模型、数据集和评分协议下,RCTA 的责任角色准确率达到 51.1%,精确根因步骤准确率达到 24.1%。作为对照,最强基线的精确根因步骤准确率只有 13.2%。这说明从长轨迹中找到“相关异常”并不等于准确锁定最早根因,后者仍是更严格、也更难的评测目标。

意义与影响

LongRCA Bench 的价值不只是增加了一个数据集,而是把智能体失败分析从结果判定推进到过程归因。对于包含多个角色、工具调用和交接环节的系统,未来的可靠性评估不能只统计任务成功率,还应衡量系统能否解释失败、定位责任边界,并指出最早的决定性错误。

同时,24.1% 的精确根因步骤准确率也表明,长程轨迹诊断仍远未成熟。摘要质量、日志可观测性、角色交接记录以及更细致的因果评估,都可能成为后续研究的关键方向。该基准及其排行榜已公开,可用于进一步比较不同诊断方法。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章