PILOT:让长程智能体在执行中实时纠偏与自我进化
导语
长程智能体的问题,往往不在于某一步完全不会做,而在于错误路径会持续累积:早期判断失误,可能让后续几十步都建立在错误前提上。传统的自我改进通常要等一次运行结束,再分析完整轨迹、总结经验,并把结果用于下一次任务。这种方式能够积累知识,却无法挽救正在进行的任务。
PILOT的核心主张是:智能体的自我改进应当“在线”发生。它提出一个监督者—工作者(supervisor–worker)框架,让一个独立的监督者观察工作进展,并在必要时介入当前运行;与此同时,系统还会把运行中出现的有效流程和失败模式整理成后续可调用的技能与记忆。
核心机制
- 实时引导(live steering):监督者与执行任务的工作者分离。当工作者偏离目标、陷入无效路径或不再值得继续时,监督者可以在任务尚未结束时重定向,甚至中止这次执行。
- 实时进化(live self-evolution):系统不只关注最终答案,也分析运行期间暴露出的程序性经验和失败原因,并将其提炼为可复用的技能和记忆。
- 监督与执行解耦:与单一上下文中的自我纠错不同,PILOT将任务执行和轨迹评估交给不同角色;与常见的子代理委派不同,它强调监督者能够影响仍在运行的工作者。
实验结果
论文在三个基准、两个冻结的基础模型上进行评估,共覆盖六组配置。PILOT在其中五组排名第一。在 Terminal-Bench 2.0 上,它相较对照框架最高提升9.8个百分点。
在自我改进设置中,使用 GLM-5.1 时性能提升14.6个百分点,使用 Kimi-K2.6 时提升12.4个百分点。同时,平均输出Token分别下降42.9%和47.4%;按每百万输出Token计算的成功评测数,则分别提升110.3%和134.0%。这些结果表明,实时干预不只是提高完成率,也可能减少智能体在错误路径上的冗长探索。
意义与待观察问题
PILOT把智能体改进从“任务后的复盘”扩展为“运行中的控制回路”,这对软件操作、终端任务以及其他步骤较多的工作流具有启发意义。监督者不再只是事后评分器,而成为能够改变当前轨迹、同时更新未来能力的系统组件。
不过,实时自我改进也带来新的工程问题。监督者需要判断哪些信号代表真正的方向性错误,哪些只是短暂失败;频繁介入可能造成额外延迟,错误重定向也可能让原本可行的路径偏离。现有摘要没有给出更细的回滚机制、干预成本或误判分析,因此这些因素仍是评估此类框架能否稳定落地的关键。论文称代码将稍后发布,后续开源实现或有助于进一步检验其可复现性与适用范围。
评论
正在确认登录状态……
正在加载评论……