BeaconKV:用“信标查询”压缩长推理模型的 KV 缓存
导语
大模型的长链式推理不仅意味着生成更多 token,也意味着需要持续保存更长的 Key-Value(KV)缓存。缓存越长,占用的显存越高;当推理轨迹达到较大规模时,显存容量会直接限制并发量、上下文长度和部署成本。现有压缩方法通常根据最近产生的查询,推测未来还会用到哪些历史 KV 对,但这一假设并不总适用于需要反复推演的推理任务。
BeaconKV 关注的正是这一缺口。论文提出一种无需训练的缓存压缩方法,核心思路不是完整保留查询历史,而是为具有相似行为的全局查询保留少量代表,即“信标查询”(beacon queries)。
核心要点
- 长程推理会回看早期信息。 研究将一类会重新关注远距离上下文的解码步骤称为 Thought Revisiting Tokens(TRT)。这些步骤可能重新访问推理初期形成的解题计划、关键条件或中间结论。
- 近期查询并非可靠代理。 如果缓存筛选只参考最新查询,早期但未来仍有价值的上下文可能被误删,尤其是在推理过程出现回溯、验证和计划调整时。
- 回访查询具有聚类特征。 论文观察到,与 TRT 相关的查询在嵌入空间中往往聚成少量相似群组。BeaconKV 为这些群组保存代表性查询,用较小的状态近似更完整的历史查询分布。
- 信标与近期查询协同工作。 方法在保留近邻信息的同时,用信标查询估计远距离 KV 的潜在重要性,再据此决定哪些缓存继续留存,从而兼顾最新上下文与长期依赖。
- 无需重新训练模型。 BeaconKV 属于训练无关的推理优化方案,目标是在不改变模型参数的情况下减少缓存开销。论文在四个开源大推理模型及多类推理基准上进行评估,报告了最高约 5.8 倍的内存缩减和超过 4.3 倍的吞吐提升,同时接近完整缓存的准确性表现。
意义与影响
BeaconKV 的价值在于重新审视了“未来重要性”如何被估计。对普通短文本生成而言,最近上下文往往足以提供有效线索;但对长推理模型来说,生成过程更像持续维护和修订一份工作计划,模型可能在若干步之后回到很早的语义节点。缓存压缩因此不能只做局部的“保近删远”,还需要保留能够代表长期访问模式的信号。
这一思路为长思维链推理的显存优化提供了一个轻量方向:通过压缩查询侧的历史信息,换取更准确的 KV 保留决策。若在不同模型架构、任务类型和硬件系统上继续验证,它有望帮助部署系统支持更长推理轨迹,或在同等显存下提高并发能力。不过,素材目前主要披露方法动机与总体结果,尚未给出各模型、基准和压缩配置的完整对比,因此具体收益仍需结合论文正文和代码进一步判断。
评论
正在确认登录状态……
正在加载评论……