4比特量化也能稳定运行:Gated DeltaNet为何没有被长上下文击穿
导语
在混合型大语言模型中,Softmax Attention负责灵活的内容交互,Gated DeltaNet(GDN)等线性注意力层则通过固定大小的递归状态压缩历史上下文。由于递归计算会把当前状态传递到后续 token,社区长期存在一种谨慎做法:保留GDN及其衰减、写入强度门控的8或16比特精度,只量化其他模块。
Hugging Face Daily Papers 收录的一项实验重新检验了这一假设。研究者以包含48个GDN层和16个注意力层的Qwen3.8-27B为对象,在不进行量化感知训练或蒸馏的情况下,将模型全部496个线性层统一采用NVFP4 W4A4。结果表明,递归部分并没有表现出预想中的脆弱性。
核心发现
- 整体精度接近BF16。 在4K和32K困惑度测试,以及MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench等任务上,Minima与BF16的差异处于随机种子波动范围附近。RULER检索测试还覆盖到64K上下文;五项任务平均结果相对BF16为-0.52。
- 门控投影反而不敏感。 GDN中的softplus、指数和sigmoid参数化会压缩误差。实验报告称,约11%的GEMM误差传递到门控输出后约为2%,因此衰减与写入强度门并不像直觉上那样容易失控。
- 递归噪声不会持续叠加。 Delta rule会沿当前key方向写入并覆盖状态。研究观察到,注入状态的扰动可在数百步内被遗忘,32K上下文中的噪声保持在相对平坦的平台,困惑度差距还会随位置增加而缩小。
- 细粒度缩放很关键。 NVFP4以16个元素为块进行缩放,有助于局部处理残差流中的极端离群值,并让不同层角色的激活误差更加均衡。
- 部署细节不可忽略。 如果推理内核把GDN投影融合为一次GEMM,却仍使用按模块校准的尺度,可能造成隐性的尺度不匹配。作者对这一问题进行了修复,发布的检查点已预先协调尺度。
意义与影响
在相同的vLLM、TP=1和单张96 GB Blackwell GPU服务环境下,完整NVFP4方案的权重大小约为17.5 GiB,相比BF16约缩小2.9倍;其预填充速度较保留部分高精度的量化方案提升约14%至19%。这说明混合架构的量化策略不应只依赖“递归模块天然脆弱”的经验判断,而应结合数值格式、门控非线性和状态更新机制共同评估。
不过,结果来自特定模型、硬件、内核和校准流程,不能直接推导出所有线性注意力模型都能无条件采用4比特。对实际部署而言,除了任务精度,还需要验证长上下文行为、融合内核的尺度处理以及不同推理框架的兼容性。总体来看,这项工作降低了混合模型进一步压缩显存和提升吞吐的顾虑,也为递归状态量化提供了更具体的实验依据。
评论
正在确认登录状态……
正在加载评论……