MemFold:让长上下文记忆服务于行动,而不只是保存信息
导语
长期服务同一用户的助手,需要记住的不只是“用户说过什么”,还包括哪些偏好仍然有效、哪些约束已经变化,以及这些信息应如何影响当前回答。传统做法往往把历史对话继续以文本形式放入上下文,结果是输入越来越长;另一条路线则把历史压缩成固定数量的隐向量,但训练目标通常是重构原文或模仿参考答案,未必真正优化了模型使用记忆时的行为。
MemFold的核心观点是:记忆压缩不应只按“保存了多少信息”来评价,更应看它是否帮助阅读记忆的模型完成任务。
核心方法
- 固定预算的软记忆:系统先根据当前查询,从文本记忆中提取相关信息,再将其压缩为K个连续向量。这些向量构成读者模型的记忆接口,使输入成本不随全部历史线性增长。
- 围绕模型自身行为训练:读者模型在软记忆条件下生成自己的结果,训练信号直接来自这些采样轨迹,而不是只在外部参考答案上学习。
- 两类互补信号:一类是面向任务结果的组相对奖励,用于衡量不同候选行为的相对表现;另一类是置信度门控的在策略蒸馏。后者让冻结的文本记忆教师,对学生已经采样出的 token 重新评分,并在教师足够有把握时提供指导。
- 教师只提供评分:教师不会参与自回归采样,因此不会额外生成一套完整答案,也不会把训练监督完全转移到学生尚未采用的分布上。推理时教师被移除,只保留软记忆与读者模型。
实验信号与意义
论文在三种Qwen骨干模型上进行评估。作者报告称,MemFold在PersonaMem-32K和PersonaMem-128K上取得其测量范围内的最高准确率,而且在更长历史长度下优势扩大;在没有目标域训练的情况下,方法还迁移到PrefEval和LongMemEval。这些结果说明,固定长度的记忆接口并不必然意味着丢失可用上下文,关键在于压缩器是否按照下游行为进行优化。
更重要的是,MemFold把“记忆”和“使用记忆”放进了同一训练闭环:文本教师保留了较完整的历史视角,学生则必须在受限的软记忆上完成真实决策。这样的设计为个性化助手、长周期代理和跨会话系统提供了一条折中路径,在控制上下文成本的同时,减少单纯重构文本带来的目标偏差。
当然,现有材料未提供完整的消融表、具体提升幅度或不同记忆预算下的细节,因此仍需结合论文全文判断方法的稳定性、计算开销及对用户偏好变化的适应能力。总体而言,MemFold的价值不在于提出更大的记忆容量,而在于重新定义了记忆压缩的优化目标:让有限记忆直接服务于模型当下要完成的任务。
评论
正在确认登录状态……
正在加载评论……