WUSH-KV:用数据自适应变换降低低比特 KV Cache 量化误差
导语
长上下文和大批量推理正在把 KV Cache 推向显存与带宽瓶颈。模型生成每个新 token 时,都要反复读取历史 Key、Value;上下文越长,缓存规模越大。因此,使用更低比特数表示 KV Cache,是提升推理效率的重要方向,但过度量化也容易放大注意力计算中的误差。
WUSH-KV 试图解决的不是“如何简单压缩”,而是“如何在压缩前重新组织数据”,让有限的量化等级更适合真实分布。
核心方法
- 从 WUSH 扩展而来:WUSH 针对矩阵乘积中的两个因子,利用它们的二阶统计信息构造数据感知变换,以降低量化误差。WUSH-KV 将这一思路适配到 KV Cache。
- Key 与 Value 分开处理:方法使用校准数据分别构造 Key 变换和 Value 变换,而不是对两者采用同一套固定变换。
- 兼顾 RoPE 与模型计算:Value 变换可以折叠进模型权重;Key 变换则放在 RoPE 之后应用,从而适应注意力计算中的数据流位置。
- 可配合裁剪量化器:这些变换并不绑定单一量化方案。论文还分析了与 QuEST INT 搭配时的性质,并在一定假设下说明 WUSH 变换接近最优。
实验观察
论文首先比较了逐层重构误差和端到端困惑度。使用 QuEST INT 时,WUSH-KV 降低了逐层重构误差,并在测试变换中取得最低的端到端困惑度。随后,研究者将 WUSH-KV 集成到 SGLang,并采用 OSCAR 风格的百分位裁剪仿射量化进行端到端评估。
在 2-bit 设置下,WUSH-KV 在所有评估模型和下游任务中,都达到与 OSCAR 变换相当或更好的表现。素材没有给出具体模型、任务或绝对指标,因此更稳妥的结论是:数据自适应变换在极低比特 KV Cache 量化中展现了稳定的竞争力,而不是宣称其在所有场景中全面取代现有方法。
意义与局限
WUSH-KV 的价值在于把量化问题与注意力计算结构结合起来:变换不是孤立地作用于缓存,而是考虑 Key、Value 在矩阵乘积中的不同角色,以及 RoPE 和权重计算的衔接方式。这为长上下文推理提供了一条兼顾压缩率与模型质量的路径,也说明校准数据可以用于更有针对性地分配量化误差。
另一方面,该方案需要校准数据来生成变换,并涉及模型权重折叠与推理框架集成,部署时仍需处理额外的离线准备和工程适配。未来实际收益还会取决于硬件对低比特算子、变换操作和缓存访问模式的支持程度。
评论
正在确认登录状态……
正在加载评论……