返回文章列表
记忆与上下文

BeaconKV:用“信标查询”压缩长推理模型的 KV 缓存

阅读约 3 分钟

导语

大模型的长链式推理不仅意味着生成更多 token,也意味着需要持续保存更长的 Key-Value(KV)缓存。缓存越长,占用的显存越高;当推理轨迹达到较大规模时,显存容量会直接限制并发量、上下文长度和部署成本。现有压缩方法通常根据最近产生的查询,推测未来还会用到哪些历史 KV 对,但这一假设并不总适用于需要反复推演的推理任务。

BeaconKV 关注的正是这一缺口。论文提出一种无需训练的缓存压缩方法,核心思路不是完整保留查询历史,而是为具有相似行为的全局查询保留少量代表,即“信标查询”(beacon queries)。

核心要点

  • 长程推理会回看早期信息。 研究将一类会重新关注远距离上下文的解码步骤称为 Thought Revisiting Tokens(TRT)。这些步骤可能重新访问推理初期形成的解题计划、关键条件或中间结论。
  • 近期查询并非可靠代理。 如果缓存筛选只参考最新查询,早期但未来仍有价值的上下文可能被误删,尤其是在推理过程出现回溯、验证和计划调整时。
  • 回访查询具有聚类特征。 论文观察到,与 TRT 相关的查询在嵌入空间中往往聚成少量相似群组。BeaconKV 为这些群组保存代表性查询,用较小的状态近似更完整的历史查询分布。
  • 信标与近期查询协同工作。 方法在保留近邻信息的同时,用信标查询估计远距离 KV 的潜在重要性,再据此决定哪些缓存继续留存,从而兼顾最新上下文与长期依赖。
  • 无需重新训练模型。 BeaconKV 属于训练无关的推理优化方案,目标是在不改变模型参数的情况下减少缓存开销。论文在四个开源大推理模型及多类推理基准上进行评估,报告了最高约 5.8 倍的内存缩减和超过 4.3 倍的吞吐提升,同时接近完整缓存的准确性表现。

意义与影响

BeaconKV 的价值在于重新审视了“未来重要性”如何被估计。对普通短文本生成而言,最近上下文往往足以提供有效线索;但对长推理模型来说,生成过程更像持续维护和修订一份工作计划,模型可能在若干步之后回到很早的语义节点。缓存压缩因此不能只做局部的“保近删远”,还需要保留能够代表长期访问模式的信号。

这一思路为长思维链推理的显存优化提供了一个轻量方向:通过压缩查询侧的历史信息,换取更准确的 KV 保留决策。若在不同模型架构、任务类型和硬件系统上继续验证,它有望帮助部署系统支持更长推理轨迹,或在同等显存下提高并发能力。不过,素材目前主要披露方法动机与总体结果,尚未给出各模型、基准和压缩配置的完整对比,因此具体收益仍需结合论文正文和代码进一步判断。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
混合语言模型中的分工:注意力负责回忆,递归状态决定表达
记忆与上下文
cctest.ai
记忆与上下文

混合语言模型中的分工:注意力负责回忆,递归状态决定表达

一项针对 Qwen3.5 和 Falcon-H1 的研究发现,混合语言模型中的 KV 缓存与固定大小递归状态承担着截然不同的任务。注意力更像事实查找表,而递归状态则决定模型接下来用什么语言、以何种 persona 作答。

阅读全文