长轨迹智能体为何难以追责?把根因归因变成持续搜索
导语
当 AI 智能体只执行几步操作时,定位失败原因并不困难;但在搜索、规划、工具调用等长时程任务中,一次失败可能对应数十万级别的执行记录。最终暴露出来的错误,未必就是最初导致任务偏离的那一步。如何从庞杂轨迹中找到真正可干预的根因,正在成为智能体可靠性工程的关键问题。
核心问题:模型太早相信第一个答案
这项工作将根因归因(Root-Cause Attribution,RCA)重新表述为一个搜索问题。相关证据可能具有三个特点:
- 出现频率低,容易被大量正常操作淹没;
- 分布在相距很远的动作之间,不能只看失败发生前后的局部上下文;
- 与可见的最终失败并不直接相连,需要结合任务过程进行推断。
现有方法通常把完整执行轨迹交给 LLM,让模型一次性给出诊断。这种方式在短轨迹上可能有效,但面对更长的记录,模型容易在读完部分信息后就接受一个“听起来合理”的解释,随后忽略能够推翻该解释的证据。论文指出,这种过早承诺也会造成同一条轨迹在重复分析时得到不同答案:每个答案都显得自信,却不一定真正触及根因。
Continual Search 如何工作
Continual Search 并不是简单增加一次提示,而是让评审过程跨越连续的多轮交互。每一轮都要求诊断者重新审视当前判断,寻找仍未检查、尚未解释或可能与现有结论冲突的证据。其核心目标不是让模型更快给出答案,而是延后定论,让搜索覆盖更广的执行范围。
论文在四个既有 RCA 基准上评估该框架,并指出现有基准普遍缺少足够大、足够长的执行轨迹。为此,研究者推出 MegaRCA-Mix:一个包含 50 条人工标注失败试验的测试集,专门考察长时程、执行密集型任务中的归因能力。摘要显示,Continual Search 在多个基准和模型系列上都带来一致改进,但提供的材料没有披露具体提升数值,因此不能将其概括为某个固定百分点的领先。
意义与影响
这项研究的价值在于改变了 RCA 的基本视角:失败诊断不只是阅读理解,也不是对最终错误做一次分类,而是一个需要管理搜索过程、证据覆盖和判断修正的推理任务。对智能体开发者而言,可靠的诊断系统应记录哪些轨迹已被检查、哪些假设仍缺乏证据,并允许模型主动挑战已有结论。
不过,持续搜索也意味着更高的推理轮次与计算成本。未来评估不仅要关注归因准确率,还应衡量搜索效率、证据可追溯性,以及诊断结果能否转化为具体修复动作。随着智能体执行链越来越长,谁能更系统地寻找“尚未被看到的证据”,可能比谁更快生成一个解释更重要。
评论
正在确认登录状态……
正在加载评论……