混合语言模型中的分工:注意力负责回忆,递归状态决定表达
导语
混合语言模型试图把 Transformer 注意力的灵活检索能力,与固定大小递归状态的高效记忆结合起来。但当两种通道同时存在时,模型究竟从哪里“记住”事实,又由哪里决定表达方式,并不容易仅凭常规生成结果判断。来自这篇论文的实验,给出了一个相当清晰的答案:注意力主要负责回忆上下文中说过的内容,递归状态则更像是在控制模型如何继续说下去。
研究如何拆分两种记忆
作者提出了两种缓存级干预方法。第一种是 split-prefill:先让模型读取一段上下文,再只保留 KV 缓存,或只保留递归状态,观察后续回答还能保留哪些能力。第二种是 state-swap:把一个上下文产生的 KV 缓存,与另一个上下文产生的递归状态配对,在同一次前向计算中生成答案。后者尤其重要,因为它不只是观察相关性,还能测试两个通道各自对输出的因果影响。
在 Qwen3.5 和 Falcon-H1 上,结果呈现出明显分工:
- 精确检索依赖注意力。 当问题要求模型复述上下文中出现过的具体项目时,仅保留 KV 缓存仍能达到完整模型准确率的约 64%—98%;只保留递归状态时,这类能力降为零。
- 输出语言依赖递归状态。 仅保留递归状态时,模型仍能保留约 70%—80%的语言表现;只保留 KV 缓存时,语言准确率降至约 1%。
- persona 也主要由递归状态维持。 递归状态保留时,persona 表现约为完整模型的 3—5 倍,而 KV-only 条件明显失效。
state-swap 进一步验证了这种分工:回答的具体内容跟随 KV 缓存一侧,使用的语言则跟随递归状态一侧。换言之,一个通道提供“要回答什么”,另一个通道影响“应该怎么回答”。
一个值得注意的边界
递归状态并非只能压缩并复述原文。实验还显示,在只使用递归状态生成时,模型能够接受上下文中从未出现、但与已见词语共享含义或部分形式的新词。这提示递归记忆保存的可能不是逐字副本,而是更抽象的语义、风格或生成倾向;不过,素材并未据此证明递归状态具备完整的概念推理能力。
意义与影响
这项工作对混合模型的设计和部署都有启发。若任务重点是长上下文中的精确引用,KV 缓存仍不可替代;若目标是维持语言、风格或角色状态,递归状态可能提供更紧凑的路径。未来的推理系统或许可以按任务动态分配两类缓存,而不是把它们视为功能重复的记忆结构。同时,研究也提醒我们,评估混合模型不能只看最终答案是否正确,还应分别测试事实回忆、语言选择和 persona 保持能力。
总体而言,这篇论文把“记忆”拆成了两个层面:注意力保存说过什么,递归状态塑造接下来如何表达。这样的功能划分,为理解混合语言模型内部的信息流提供了一个简洁而可检验的框架。
评论
正在确认登录状态……
正在加载评论……