返回文章列表
记忆与上下文

KV 缓存压缩暴露周期性弱点:同一信息为何因位置而难易不同

阅读约 3 分钟

长上下文模型通常被寄予“只要信息在上下文里,就应该能够找出来”的期待。但一项关于分块 KV-cache 压缩的新研究显示,这个前提并不总是成立:当模型把连续 token 压缩成更少的缓存条目后,同一段信息仅仅因为相对于压缩窗口的起始位置不同,就可能变得更容易或更难检索。

从缓存压缩到“相位”

分块 KV-cache 压缩会按照固定步长处理连续窗口。例如,窗口长度为 8、步长为 4 时,token 相对于窗口边界的位置就形成了一个周期性坐标,研究者称之为 phase(相位)。在不改变文本内容和顺序的情况下,只要在前面增加一个 token,后续内容的相位就会整体移动。若模型表现随这一移动而变化,问题就来自压缩机制本身,而非输入数据。

研究者在 DeepSeek-V4-Flash-Base 上构造了一个直观案例:代码内容完全不变,仅逐步延长无关文档字符串,模型对同一处 FP8 内核代码的预测便会在正确答案 8 与 32 之间周期切换,周期约为 4。相比之下,没有采用分块压缩的 DeepSeek-V3.1-Base 没有呈现同样的规律性偏好。

平均准确率掩盖了什么

在针搜索式长上下文测试中,研究者控制了目标位置分布、查询位置以及提示规模,只改变目标内容所处的压缩相位。DeepSeek-V4 的不同模型都出现了以步长为周期的起伏,最佳和最差相位之间的准确率差距约为 15 至 40 个百分点。后训练能够提升总体准确率并缩小差距,但无法消除周期。

这一现象并非某个具体模型的偶然缺陷。研究者从头训练了一组小型 Transformer,并将分块压缩作为区别于全注意力基线的主要因素。改变窗口大小、步长、KV 头数量、门控方式和位置编码后,周期仍大体跟随压缩步长。受控实验中,压缩模型的平均准确率可能接近全注意力模型,但最差位置的表现却显著落后,极端情况下相位差距达到 78 个百分点。

注意力头为何会“分工”

因果干预表明,不同注意力组件并不是均匀参与检索。有些头只在相邻的少数相位上发挥重要作用,其他头则覆盖不同位置。进一步实验发现,压缩门控倾向于在每个窗口反复选择相似槽位,键和值门之间还存在固定的偏移,使某些 token 与后继 token 更容易被共同保留。

当研究者循环移动门控参数时,弱点也随之移动,而其他模型权重保持不变。这说明相位敏感性与压缩门控的布局存在直接关系。理想化模型分析还提示,梯度训练可能偏好让每个头集中于某个固定槽位,却没有足够动力主动填补所有相位,从而形成周期性的覆盖空洞。

对评测和部署的影响

这项工作提醒开发者,KV-cache 压缩不能只用平均长上下文准确率衡量。更可靠的报告方式应包括各压缩相位的准确率、最佳与最差相位差距,以及不同步长和窗口配置下的稳定性。对于代码补全、长文档问答和检索增强生成等任务,输入前缀的微小变化可能改变目标的相位,进而影响结果。

压缩并不因此失去价值:它仍能降低缓存占用和注意力成本。但在追求更长上下文时,系统需要把“平均能否找回信息”进一步拆解为“在周期中的每个位置能否稳定找回信息”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章