4-bit 不一定更弱:QAH 让压缩模型反超其全精度版本
导语
模型压缩通常意味着能力折损:先删减层、注意力头或神经元,再把权重降到 4 bit,内存和推理成本下降了,但推理、数学与代码能力也可能受到影响。Hugging Face Blog 介绍的一项新方法 Quantization-Aware Healing(QAH),试图改变压缩模型的恢复方式。
核心要点
- 教师模型换了:传统量化感知蒸馏通常让量化学生模仿压缩后的 BF16 模型。QAH 则直接使用压缩前的全尺寸、全精度模型作为教师,即使双方架构不同,也通过输出 logits 的分布进行知识迁移。
- 量化不再只是收尾步骤:在常见流程中,模型先压缩、再量化,最后修复损失。QAH 把量化阶段视为一次新的蒸馏过程,让学生继续从原始模型获取此前未充分转移的信息。
- 长上下文训练更节省显存:该方案采用分块计算 KL 散度的损失函数,不必一次性生成完整的“序列长度×词表”张量,因此可以处理最长 32k token 的训练样本。
实验结果怎么看
研究团队将 GPT-OSS 120B 压缩为 60B,先恢复出 BF16 版本,再通过 QAH 量化为 MXFP4。与同一个 60B 架构的 BF16 检查点相比,QAH 模型在 9 项测试中的 7 项得分更高:AA-LCR 长上下文推理提升 7.4 分,AIME 2025 数学提升 5.6 分,Aider、工具使用、科学问答、指令遵循和 LiveCodeBench 也有所提升。MMLU-Pro 低 0.2 分,SciCode 低 1.4 分。
它还在 LiveCodeBench 上以 66.5 分略高于 120B 教师模型的 66.0 分。不过,这并不意味着压缩模型已经全面超越大模型:在 GPQA Diamond 上,QAH 仍为 67.4 分,低于教师的 69.0 分;长上下文任务与模型容量相关,仍是最难弥补的差距。
意义与限制
QAH 的价值在于重新定义了“量化修复”:学生不必被锁定在一个已经受结构压缩影响的中间模型上,而可以直接接近原始模型的行为分布。这为低显存部署、成本敏感的推理服务提供了新路径,也说明 4-bit 模型的质量不只取决于量化格式,还取决于训练监督来自哪里。
但现有结果来自特定 GPT-OSS 配置、MXFP4 格式和有限基准。两个测试出现退步,且材料未提供完整的训练成本、数据规模与不同模型架构的验证。因此,QAH 更适合被看作一种有潜力的压缩后恢复配方,而不是“4-bit 必然优于 BF16”的普遍结论。
评论
正在确认登录状态……
正在加载评论……