返回文章列表
记忆与上下文

把大模型的经验“蒸馏”给小代理:AMD 的层级记忆思路

阅读约 2 分钟

在“小模型也想做好代理任务”这件事上,AMD 给出的思路很直接:既然小模型自己很难积累足够多的成功轨迹,那就从强教师那里把经验整理出来,再以更适合推理的方式喂给它。与其让学生模型从零试错,不如把已经验证过的路径、步骤和工具用法拆成可复用的记忆。

这项方法做了什么

AMD(Agent Memory Distillation)不是再训练一个新模型,而是一套训练免费的记忆迁移框架。它从教师代理的成功轨迹中构建三类互补记忆:

  • Workflow memory:面向任务层,概括整体策略和执行流程
  • Subtask memory:面向子任务层,给出更具体的行为样例
  • Function memory:面向函数调用层,记录接口习惯、常见错误和坑点

这三种记忆的注入方式也不同:Workflow 和 Subtask 会在任务开始时主动提供给学生模型,帮助它先建立“怎么做”的框架;Function memory 则是在工具调用出错时按需检索,用来纠正具体的调用问题。

为什么这个设计有意义

对小型 LLM 来说,难点往往不只是“会不会想”,而是“能不能稳定做对”。工具型代理任务尤其如此:它既要规划步骤,又要正确调用外部工具,还要从失败中快速修正。AMD 的层级记忆恰好把这三类能力拆开处理,让小模型不必同时承担全部学习压力。

结果说明了什么

论文在 AppWorld、BFCL V3 和 ToolSandbox 三个工具使用基准上进行了评测,使用了四个 4B 到 8B 参数的学生模型,并以 GPT-5-mini 作为教师。结果显示,AMD 相比已有基于记忆的方法有更稳定的提升;其中,子任务记忆贡献最大。作者还指出,教师是否有效,不只取决于教师本身够不够强,也取决于它和学生模型是否匹配;另外,4B 规模的学生模型受益最明显。

这篇工作的价值

从方法论上看,AMD 把“知识蒸馏”从参数层面推进到记忆层面,更贴近代理系统的实际工作方式。它的启发是:对于资源受限的小模型,提升代理能力未必总要靠更大训练和更多参数,也可以靠更聪明的经验组织方式。

如果未来这类记忆可以更自动地构建、压缩和更新,小模型代理在真实工具环境中的实用性可能会继续提高。

来源链接:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
ALiBi 位置编码的“失明”问题:长距离注意力可能被数值精度吞掉
记忆与上下文
cctest.ai
记忆与上下文

ALiBi 位置编码的“失明”问题:长距离注意力可能被数值精度吞掉

一篇新论文指出,ALiBi 的线性位置偏置在浮点计算中可能发生下溢,使部分注意力权重被压成零,导致某些注意力头对远距离信息“失明”。研究显示,这一问题会明显影响 token 检索,但在常规解码器基准上未必显著暴露。

阅读全文