返回文章列表
推理与部署

HyQuant:用混合精度缓解大模型注意力量化误差

阅读约 3 分钟

导语

低比特量化已经成为降低大语言模型推理成本的重要手段,但注意力模块尤其是KV缓存并不容易压缩。上下文越长,缓存占用越大;而当键值状态被压缩到很低的比特数时,少量关键位置的误差可能被放大,进而影响长上下文理解和推理。HyQuant的核心思路不是把所有状态一视同仁,而是识别注意力中更值得保留精度的区域。

关键观察:误差集中在少数位置

论文及其配套说明指出,在Qwen3、Llama 3、Gemma 4和Qwen3.5等模型的注意力图中,存在较稳定的“垂直线”模式:少数关键Key位置会被大量查询Token反复关注。素材称,排名靠前的5% Key位置与最近的128个Token组成的区域,可以覆盖约82%至86%的注意力质量。这一观察为混合精度提供了依据——如果最敏感的部分保留高精度,其他区域就有机会采用更激进的压缩策略。

HyQuant如何工作

  • 选择关键区域:利用轻量的、面向垂直线的注意力模式信号,筛选需要重点保护的Token,相关识别开销据称约为运行时间的3%至5%。
  • Prefill阶段混合计算:处理输入上下文时,保留垂直线Token和局部滑动窗口的FP16状态,其余上下文使用低比特表示。
  • Decode阶段压缩KV缓存:在生成阶段沿用同样的划分原则,将大部分KV缓存压缩,同时把反量化过程与注意力计算融合,减少额外的内存搬运。
  • 硬件实现:作者为Prefill和Decode提供混合精度内核,目标是在降低缓存占用的同时避免单纯量化方案可能产生的计算与访存损失。

实验结果意味着什么

素材中的单张H100结果显示,在32K上下文下,HyQuant的Decode内核最高可达到FlashAttention-2的3.58倍;但端到端Decode加速幅度为1.04至1.17倍,说明内核收益会受到整体工作流中其他环节的限制。Qwen3-8B思考模式在LongBench上的平均分为45.04,而FlashAttention-2为44.59;对比之下,素材列出的KIVI、SageAttention和KVTuner结果为37.7至40.5。作者还报告称,在32K前缀、batch size为16的设置下,HyQuant仍能运行,吞吐为231.6 token/s,而列出的其他对比方法出现显存不足。类似趋势据称也出现在Qwen3-32B、Llama 3.1-8B和GLM-4-9B上。

意义与边界

HyQuant的价值在于把“量化”从统一降精度改造成按注意力重要性分配精度:关键状态获得保护,大规模普通状态承担主要压缩收益。这种设计对长上下文服务尤其有吸引力,因为KV缓存通常是显存压力的重要来源。不过,当前素材中的性能数字来自特定模型、任务、上下文长度和单卡H100环境,不能直接推导为所有硬件或工作负载下的普遍加速。实际部署仍需关注关键Token识别开销、内核兼容性以及不同模型注意力模式的稳定性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章