把大模型的经验“蒸馏”给小代理:AMD 的层级记忆思路
在“小模型也想做好代理任务”这件事上,AMD 给出的思路很直接:既然小模型自己很难积累足够多的成功轨迹,那就从强教师那里把经验整理出来,再以更适合推理的方式喂给它。与其让学生模型从零试错,不如把已经验证过的路径、步骤和工具用法拆成可复用的记忆。
这项方法做了什么
AMD(Agent Memory Distillation)不是再训练一个新模型,而是一套训练免费的记忆迁移框架。它从教师代理的成功轨迹中构建三类互补记忆:
- Workflow memory:面向任务层,概括整体策略和执行流程
- Subtask memory:面向子任务层,给出更具体的行为样例
- Function memory:面向函数调用层,记录接口习惯、常见错误和坑点
这三种记忆的注入方式也不同:Workflow 和 Subtask 会在任务开始时主动提供给学生模型,帮助它先建立“怎么做”的框架;Function memory 则是在工具调用出错时按需检索,用来纠正具体的调用问题。
为什么这个设计有意义
对小型 LLM 来说,难点往往不只是“会不会想”,而是“能不能稳定做对”。工具型代理任务尤其如此:它既要规划步骤,又要正确调用外部工具,还要从失败中快速修正。AMD 的层级记忆恰好把这三类能力拆开处理,让小模型不必同时承担全部学习压力。
结果说明了什么
论文在 AppWorld、BFCL V3 和 ToolSandbox 三个工具使用基准上进行了评测,使用了四个 4B 到 8B 参数的学生模型,并以 GPT-5-mini 作为教师。结果显示,AMD 相比已有基于记忆的方法有更稳定的提升;其中,子任务记忆贡献最大。作者还指出,教师是否有效,不只取决于教师本身够不够强,也取决于它和学生模型是否匹配;另外,4B 规模的学生模型受益最明显。
这篇工作的价值
从方法论上看,AMD 把“知识蒸馏”从参数层面推进到记忆层面,更贴近代理系统的实际工作方式。它的启发是:对于资源受限的小模型,提升代理能力未必总要靠更大训练和更多参数,也可以靠更聪明的经验组织方式。
如果未来这类记忆可以更自动地构建、压缩和更新,小模型代理在真实工具环境中的实用性可能会继续提高。
评论
正在确认登录状态……
正在加载评论……