Metis:把记忆做进基础模型的原生能力
导语
在当前 AI Agent 系统中,“记忆”通常不是模型本身的一部分,而是由向量数据库、检索器、缓存、长期存储和提示词拼接流程共同完成。这样的设计灵活,但也让记忆能力更像外围工程:系统需要决定存什么、何时取、如何塞回上下文。Metis 这篇论文提出了一个更激进的方向:把记忆变成基础模型的原生能力。
论文将这一类模型称为 Memory Foundation Model(记忆基础模型)。其目标不是简单扩大上下文窗口,也不是再接一个 RAG 模块,而是在模型骨干中维护一个可持续演化的记忆状态,让历史信息能被压缩、保留,并在后续推理中直接参与计算。
核心要点
- 记忆状态内置于模型骨干:Metis 将 native memory state 定义为一种持久、动态变化的内部状态。它不是外部数据库条目,而是会随着会话推进而更新,并参与后续模型计算。
- 记忆流程由模型学习:论文提出 native memory procedures,即模型通过训练学会“应该存什么”以及“怎样使用已存信息”,减少对人工规则和外部流水线的依赖。
- Metis Block 是关键结构:每个 Metis Block 结合 Local Memory Block 与 Hyper Memory Block。前者负责维护持久记忆状态,后者学习存储和使用记忆的过程。
- 历史信息被压缩为固定大小会话状态:模型不必在后续查询时重放完整历史,而是通过 memory attention 访问压缩后的记忆状态。
- 推理阶段无需更新权重:Metis 的在线记忆维护是无梯度的,记忆更新只需要前向计算;推理时学习到的模型权重保持冻结,变化的是原生记忆状态。
- 已发布不同规模检查点:作者称已释放实现,以及基于 Qwen3.5 的 4B、9B、27B 规模检查点。
意义与影响
Metis 的重要性在于,它把 Agent 记忆问题从“系统工程”推向“模型能力”。如果这种路线成立,未来的长期对话、个性化助手、多轮任务执行,可能不再完全依赖外部检索和上下文拼接,而是让模型在内部维持可更新的会话状态。
这也可能带来效率优势。传统做法常常需要反复加载历史、检索片段、构造长提示;Metis 则尝试把历史压缩进固定大小状态,再通过注意力机制访问。对于长程交互场景,这种思路有望降低重复上下文处理的成本。
当然,论文素材主要介绍了方法与原型,仍需更多公开评测来验证其在不同任务、长时间会话、记忆可靠性和安全边界上的表现。尤其当记忆成为模型内部状态后,如何解释、删除、隔离和审计记忆,也会成为必须面对的新问题。
总体来看,Metis 提供了一个值得关注的范式:不是给大模型外挂记忆,而是让记忆成为模型架构和训练目标的一部分。它可能是 Agent 从“会调用工具”走向“能持续记住”的一次基础设施尝试。
评论
正在确认登录状态……
正在加载评论……