4比特压缩模型如何“自愈”:QAH绕开QAT的训练陷阱
大模型部署的压缩通常分两步进行:先减少参数规模,再把权重压到4比特。前者降低模型容量,后者进一步减少显存和存储占用,但两种操作也会叠加带来精度损失,尤其容易影响推理、数学、代码生成和长上下文任务。因此,压缩完成后通常还需要一个“修复”阶段,也就是让模型重新适应新的参数结构和数值表示。
传统方案是量化感知训练(QAT)。它在训练过程中模拟低比特权重,并用硬标签重新拟合压缩后的模型。论文作者观察到,这种方式在其流程中收敛较慢,而且训练继续进行后会在达到最佳点后出现性能坍塌。更关键的是,结构化压缩模型本身并没有经历一次完整的全精度独立训练,其bfloat16检查点更像是从原始模型恢复出的近似版本。如果把这个近似版本继续当作唯一学习目标,修复过程的上限可能已经被提前限定。
QAH的核心变化,是让4比特学生模型直接蒸馏原始、未压缩的教师模型。训练时,学生不仅要适应量化后的权重表达,还要尽可能匹配教师模型提供的输出分布。这样做把“恢复压缩损失”和“学习任务行为”结合到同一个过程里,避免学生只围绕已经退化的硬标签进行拟合。
论文给出的案例是GPT-OSS 120B到60B再到MXFP4的压缩流程。最终学生模型被命名为Hypernova-60B,参数量约为教师的一半,权重内存约减少到四分之一。在9项基准中,它有7项达到或超过自己的bfloat16来源模型。这里的结果并不意味着低比特模型在所有任务上都必然优于全精度模型,但说明结构化压缩和量化后的性能损失并非只能被动接受。
核心要点:
- QAH以原始未压缩模型为蒸馏教师,而不是只依赖压缩后的恢复模型。
- 相比匹配的QAT基线,QAH达到相近峰值的速度约快7倍。
- QAH在继续训练时更稳定,不依赖人工挑选早停点来避免性能坍塌。
- 作者还发现,不同分布式训练后端之间可能存在显著且可复现的质量差异,工程实现本身会影响结果。
这项工作的实际价值,在于把压缩模型修复从“不断试超参数、寻找最佳检查点”推进到更可重复的训练配方。论文讨论还提到,作者通常无法获得原始模型的完整训练语料,而是使用高质量公开数据与任务数据完成QAH;不过这属于作者在多个开源模型上的实践经验,不能直接等同于对所有模型和数据规模的普遍保证。
对部署团队而言,真正需要关注的不只是峰值分数,还包括训练能否稳定完成、模型是否需要原始语料、分布式后端是否改变质量,以及低比特模型在目标任务上的长期表现。QAH提供了一条值得复现的路径,但其收益仍应通过完整基准、不同压缩比例和实际业务数据进一步验证。
评论
正在确认登录状态……
正在加载评论……