返回文章列表
AI 智能体

AutoSaddler:让智能体从失败轨迹中自动优化执行框架

阅读约 3 分钟

导语

大语言模型智能体的能力,不只取决于模型本身,也取决于围绕模型搭建的执行框架(harness)。提示词如何组织、工具如何调用、任务何时重试、上下文如何维护,都会影响智能体能否完成一个持续数十步甚至更长的任务。问题在于,框架设计通常依赖人工经验,调试过程昂贵,而且很难覆盖所有失败模式。

微软等机构提出的 AutoSaddler,尝试让这一过程变得更自动化。它不把一次失败简单视为模型能力不足,而是把智能体的完整执行轨迹当作诊断材料,寻找框架层面的缺陷,并以代码补丁的方式迭代更新。

核心方法

AutoSaddler 的整体流程可以概括为三个环节:

  • 失败轨迹诊断:系统收集小批量任务中的失败执行记录,分析错误发生的位置、上下文和可能原因,而不是只依据最终得分进行浅层反思。
  • 结构化补丁生成:框架被视为一组可执行代码、提示词、工具配置和控制逻辑。系统据此提出范围明确的修改,避免无约束地重写整个 harness。
  • 验证式更新选择:候选修改不会因为修复了一条轨迹就直接生效,而要经过额外验证,判断其是否能改善更广泛的任务表现,从而降低“针对单个样本过拟合”的风险。

研究将 harness 优化表述为一种离线学习问题:先利用已有执行轨迹提取失败信号,再通过多轮更新逐步改进框架。这样的设计不要求智能体在每次运行时即时探索,也使失败经验能够沉淀为持续生效的框架改动。

实验与关键发现

在 GAIA2、SWE-Bench Pro 和 Terminal-Bench 2.0 上,AutoSaddler 相比对应的基础 harness 分别提升了 9.0、9.6 和 10.0 个百分点。虽然这些结果不能说明所有任务都适合采用同一种优化策略,但它们显示出一个重要趋势:在模型不变的情况下,执行框架仍然拥有可观的性能改进空间。

消融实验进一步指出,三个因素尤其重要。第一,深度调试比泛泛而谈的反思更有效;第二,围绕明确问题进行定向修改,比开放式编辑更稳定;第三,更新选择必须关注跨轨迹泛化,而不能只奖励对某一次失败的修复。

意义与影响

AutoSaddler 的价值在于重新定义了智能体工程的优化对象。过去,研究者往往把提示词、工具链和控制器视为固定配套,主要通过更换模型或增加推理步骤来提升效果。该工作则表明,harness 本身可以像软件系统一样被调试、测试和持续演进。

这条路线仍有边界:自动生成的补丁需要可靠验证,失败诊断也可能受到轨迹质量和评测覆盖范围的影响。因此,未来的重点不仅是生成更多修改,还包括建立更严格的回归测试、风险控制和跨任务评估机制。对需要长期运行的编码、终端操作和研究型智能体而言,能够把一次失败转化为可复用的系统改进,可能比单纯增加模型规模更具工程价值。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章