返回文章列表
记忆与上下文

把持续学习机制组合起来,语言模型长期记忆提升28倍

阅读约 2 分钟

导语

语言模型如果要持续吸收不断到来的新知识,就不能只看当前任务的训练损失,还要在多轮更新后保住先前学到的内容。来自约翰斯·霍普金斯大学的研究将这一问题称为“长时程记忆”(long-horizon memorization),并考察了多种持续学习机制组合后的效果。

问题:更新越多,记忆越容易被覆盖

研究设置了一个连续监督微调场景:模型依次学习100个问答任务,训练过程中不保留早期样本,推理时也不提供任务编号。这样的限制更接近长期运行的模型系统:新数据不断写入,但旧数据未必还能被完整访问。

在朴素的顺序式SFT中,后续任务会显著改写模型参数,导致早期问答能力快速下降。论文报告的三个数据集结果显示,最终平均保留率只有1.2%。研究者还发现,单独使用某一种持续学习机制,并不能在如此长的任务序列中稳定维持较强记忆。

核心方法:从两个维度组合保护机制

论文把候选机制归纳为两个设计维度:

  • 保护什么:数据锚点、函数锚点和权重锚点,分别从不同层面约束更新过程,使模型尽量保留既有信息、行为或参数状态。
  • 写入哪里:低秩分配规则决定连续更新如何占用和组织LoRA等低秩参数空间。

在这些组件中,最佳方案同时使用三类锚点,并采用合并式LoRA(merged LoRA)保存后续更新。它在三个不同的100任务数据集上都进入表现最好的前三名,最终平均保留率达到34.9%,相较朴素顺序微调的1.2%提高约28倍。

为减少组合搜索成本,研究引入了任务级successive halving,对候选方案进行逐步筛选;随后又用析因实验分析各组件的独立效果与交互作用。结果显示,数据锚点和合并式LoRA带来的平均收益最大,而且二者在三个数据集上都呈现“超加性”协同:组合效果超过简单相加的预期。

意义与局限

这项工作的重要启示是,持续学习未必存在一个能够单独解决长期遗忘的“万能模块”。遗忘可能同时发生在训练数据、模型函数行为和参数更新空间等层面,因此跨层组合更有机会维持记忆。

不过,34.9%的保留率也说明问题尚未解决。实验聚焦于精心定义的连续问答记忆任务,不能直接等同于真实产品中的开放世界知识更新。未来还需要检验这些机制在更复杂任务、更长更新链以及实际数据分布变化下的稳定性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章