Memory Decoder at Scale:把长期记忆从大模型参数中“拆出来”
导语
大语言模型通常把两件事压进同一套参数里:一方面要“记住”训练数据中学到的长期知识,另一方面又要在生成时完成推理、组合和表达。这样做简单直接,但也带来一个问题:如果模型需要更多长期记忆,我们往往只能继续扩大整个模型,而不是单独增加“记忆容量”。论文 Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory 正是围绕这个矛盾展开,提出并放大了一种参数化长期记忆模块。
核心要点
-
思路:拆分记忆与推理
该工作延续 Memory Decoder 的方向,把长期记忆从 decoder-only 模型的主干推理参数中相对独立出来。基础模型负责语言建模与推理,外接或配套的 memory 模块则承担更大规模的知识存储。 -
规模:记忆模块扩展到 6.9B 参数
与此前较小规模研究相比,作者将 memory model 扩展至最高 6.9B 参数,并在 300B tokens 上进行预训练。这使论文重点从“方法是否可行”推进到“在较大规模下是否仍有收益”。 -
工程瓶颈:传统 Faiss 流程不再够用
在 300B token 级别,索引和检索成本会迅速膨胀。论文提出分布式 Faiss 索引与检索管线,并结合稀疏、按 batch 加载的 kNN 分布,降低大规模记忆检索中的系统负担。 -
结果:小骨干 + 大记忆具备竞争力
论文报告称,在 17 个基准上,Pythia-410M 搭配 6.9B 通用记忆后,平均分从 29.86 提升到 37.34,略高于 Pythia-12B 的 37.24,同时总参数少 39%。在 Qwen3 Base 0.6B 到 14B 的不同规模上,1.7B 领域记忆也能让三个领域的平均分在每个规模上提升超过 9 分。
意义与影响
这项工作最值得关注的不是某一个单点分数,而是它提出的扩展范式:未来模型能力提升未必只能依赖“把主模型做得更大”。如果记忆可以被独立预训练、独立扩容,并在推理时与较小骨干模型配合,那么模型部署和训练的参数预算可能会有新的分配方式。
当然,这一路线也会把复杂度转移到系统层面:大规模索引、检索延迟、memory 与 backbone 的协同训练,以及不同领域记忆如何组合,都会影响实际可用性。但论文给出的结果说明,参数化长期记忆不只是概念设计,在数十亿参数和数千亿 token 训练规模下也可能带来可衡量收益。
对行业而言,“小推理核心 + 大知识记忆”可能成为长上下文、领域增强和低成本模型扩展之外的另一条路线。它与 RAG 不完全相同:RAG 依赖外部文档检索,而这里的记忆本身是可训练参数。两者未来也可能结合,形成更灵活的模型记忆体系。
评论
正在确认登录状态……
正在加载评论……