返回文章列表
AI 智能体

ASCENT:让长程智能体在部署过程中持续学习

阅读约 3 分钟

导语

长程智能体要完成一个现实任务,往往需要连续进行多轮推理、调用工具和执行动作,最终才得到一个成功或失败信号。部署环境中的任务通常并非彼此孤立,而是组成一串具有相似结构的任务流。因此,前一次执行留下的轨迹,理论上可以成为后续改进的训练数据。

但“把刚才做过的事情再学一遍”并不简单。现有的上下文适应方法通常将反思、记忆或技能保存为文本,效果取决于能否检索到正确经验,也取决于冻结的模型能否准确执行这些文本。若直接模仿一次生成的动作,或根据单次结果强化生成过的词元,错误和偶然行为也可能被一并放大,进而造成策略不稳定。

ASCENT的核心思路

ASCENT,即“面向跨任务演化的智能体自蒸馏”,把已验证的执行经验转化为更稳定的训练信号,主要包含三步:

  • 在线执行一次:智能体按顺序处理任务流,每个任务只执行一遍;这次执行及其终止验证结果,是后续更新的唯一学习信号。
  • 引入事后视角:模型保留一个冻结的初始副本,让它读取包含验证信息的完整轨迹。与执行当下相比,这个副本拥有“知道结果之后”的特权信息,因此可以在轨迹各位置给出更有针对性的下一词元分布。
  • 更新快速权重:将这些分布蒸馏到持久化的LoRA参数中,使更新后的智能体在后续任务中受益,同时避免直接把一次尝试中的全部行为当作正确答案。

研究还进一步移除了无效动作对应的回合,使蒸馏目标集中于更有价值的经验。这里的关键不是增加一名外部教师,而是让同一模型的稳定初始版本利用完整轨迹提供事后指导。

实验与意义

根据论文介绍,ASCENT在ALFWorld和WebShop上,相比基础模型将精确成功率提高了超过22个百分点,而且在两种模型规模下都观察到了这一趋势;同时,智能体完成每个任务所需的回合数减少。方法带来的收益还能够迁移到保留测试的未见场景中。上述结果表明,测试时训练不一定需要额外标注数据、参考解或更强模型,经过验证的自身经验也可以成为持续适应的来源。

更重要的是,ASCENT把智能体学习问题从“保存一段文字记忆”推进到“更新可执行策略”。这对于需要连续处理相似任务的部署系统具有吸引力:经验不再只依赖检索,而是可以沉淀到参数中。不过,论文讨论的设定仍然依赖终止时的验证信号,且单次轨迹训练本身存在风险。如何在更嘈杂、更稀疏或更开放的反馈环境中保持稳定,将是这类在线学习方法走向实际应用时需要继续解决的问题。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章