REMORY:给上下文压缩补上一段“残差记忆”
长程智能体的一个现实约束是:历史越长,越不可能把所有对话、工具调用和中间结果原样保留在上下文窗口里。常见做法是把历史压缩成一段文本摘要,但摘要并不总能承载后续决策所需的全部线索。REMORY针对的正是这个缺口:它不试图完全替代摘要,而是在摘要之外增加一段可学习的“残差记忆”。
方法核心
REMORY使用一个独立的神经记忆网络。输入包括原始历史与已经生成的摘要,网络输出长度受限的一组软记忆Token。这些Token不是面向人类阅读的文字,而是供语言模型直接处理的连续表示。生成后,它们会被追加在摘要之后,再交给冻结的语言模型完成后续任务。
这一设计可以理解为沿序列维度建立了一条“残差连接”:摘要负责提供可解释、紧凑的主干信息,软记忆则补回摘要中没有显式写出、但可能影响模型行为的部分。训练目标不是让记忆网络复述历史,而是让冻结语言模型在压缩输入下,尽可能接近它读取完整历史时会产生的延续。这样,记忆内容的价值由下游行为来衡量,而不只是由文本相似度判断。
实验信号
- 在SummHay测试中,REMORY改善了来源归因能力,同时洞察覆盖率基本没有变化。
- 该方法仅使用约5.2%的输入位置,就接近完整上下文条件下的联合得分。
- 在长程智能体基准上,Qwen3.8-27B与GLM-5.3-Flash都呈现出一致收益。
- 在BrowseComp和Terminal-Bench 2.1中,加入残差记忆后,两个模型的重复工具输出和工具错误显著减少。
为什么值得关注
REMORY的重要性不只在于“压缩得更短”,还在于它改变了上下文压缩的接口。传统摘要把信息压缩成模型需要再次阅读的自然语言;REMORY则把一部分难以用文字稳定表达的状态,编码成面向模型内部处理的软Token。二者结合,有机会同时保留可检查性与行为有效性。
这也意味着,未来的上下文管理可能不必在“完整历史”和“单一摘要”之间二选一,而是采用分层方案:摘要承担显式记忆,软记忆承担隐式补偿。对于需要频繁调用浏览器、终端或其他工具的智能体,减少重复输出和工具错误尤其重要,因为这些问题会消耗上下文预算,并可能形成连锁失败。
不过,现有材料主要展示了方法与基准结果,并未说明软记忆在不同任务间的可迁移性、具体Token预算如何选择,以及记忆网络训练和部署带来的额外成本。因而,REMORY更适合被看作一种有前景的上下文压缩方向,而不是已经解决长程记忆问题的通用方案。
评论
正在确认登录状态……
正在加载评论……