Grouped Value Attention:用按需重建键进一步压缩 KV Cache
导语
在长上下文和大规模并发推理中,KV Cache 往往比模型参数本身更直接地限制显存利用率。自回归解码每生成一个 token,就要把新的 key 和 value 写入缓存;之后的每一步又需要读取越来越长的历史缓存。Grouped-query attention(GQA)通过让多个查询头共享 key-value 头,已经降低了这一开销,但每个时间步仍同时保存 key 和 value。
论文《Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction》提出 Grouped Value Attention(GVA),尝试从表示方式本身继续削减缓存规模。
核心要点
- 重点保存分组值。 GVA 将值组织为分组表示,并不按传统方式为每个位置持久化完整的内容 key。
- 按需重建内容键。 一个学习得到的线性映射负责连接值表示与内容键。在推理时,该映射可以吸收到 query 变换中,从而在设计目标的解码路径上不必实际物化内容键。
- 单独保留位置信息。 为避免压缩内容表示后丢失位置信息,方法加入一个较小、共享的解耦 RoPE 通道,并缓存对应的 positional key。论文考察了不同位置通道配置,其中包括 16 维版本。
- 缓存规模明显下降。 在论文测试的配置中,GVA 相比匹配的 GQA 可减少约 45%—47% 的持久化缓存标量。这是表示层面的容量比较,不等同于已经验证的端到端延迟或吞吐提升。
- 准确率接近 GQA。 在 350M 参数规模、使用 30B FineWeb-Edu token 训练的实验中,16 维位置变体在五项任务上的平均准确率为 44.18;对照的 GQA 为 44.36,MLA 为 43.88。
意义与限制
GVA 的价值不只是“少存一些数字”,还在于它试图把 KV Cache 中的内容信息与位置信息分离,并把部分重建工作转移到 query 侧。对于长序列服务、多请求批处理以及显存受限的部署环境,这种设计可能降低缓存占用和缓存读流量,为更大的批次或更长上下文留下空间。
不过,缓存标量减少并不会自动转化为更快的生成。实际收益还取决于内存访问模式、矩阵运算开销、内核融合和硬件利用率。论文作者表示已经开发定制解码内核,正在评估端到端推理性能,开源版本也计划随后发布。因此,当前结果更适合被理解为一种有潜力的 KV Cache 表示方案,而不是已经完成验证的通用加速方案。后续值得关注的是:在更大模型、更长上下文和不同批处理规模下,重建计算是否会抵消节省的缓存流量,以及位置通道维度对质量与效率的实际权衡。
评论
正在确认登录状态……
正在加载评论……