返回文章列表
世界模型

QuantWM:用注意力保持破解视频世界模型的2比特缓存难题

阅读约 2 分钟

视频世界模型要在较长时间范围内生成连贯内容,通常会把历史计算得到的 Key-Value(KV)缓存保留下来。缓存能够帮助模型回看此前的时空信息,但随着生成过程推进,其规模持续增长,也成为部署阶段的重要显存负担。将 KV Cache 压缩到 2 比特看似是直接有效的解决方案,然而现有方法在通用指标上表现接近无损,并不意味着它们适合视频世界模型:实际生成中仍可能出现明显的时间闪烁和画面退化。

QuantWM 的核心贡献,是把问题从“如何降低数值重构误差”转向“如何保持注意力行为”。论文观察到,Key 量化后的重构误差可能小于 Value,但最终输出退化反而更严重。原因在于,Key 不只是被动参与数值计算,它还会与 Query 共同决定注意力 logits。哪怕扰动幅度不大,也可能改变模型在时间和空间维度上选择的 token,进而破坏跨帧内容的一致性。

方法要点包括:

  • 量化敏感性感知聚类(QSAC):综合历史 Query 对不同通道的敏感程度与残差范围,选择更适合 INT2 表示的 Key 聚类中心,把有限的量化精度优先分配给更影响注意力的部分。
  • 主子空间注意力补偿(PSAC):针对量化后仍然存在的 Key 误差,在 Query 的主导子空间方向上进行补偿,目标是恢复受到扰动的注意力关系。
  • 无需训练:QuantWM 不依赖额外训练流程,而是在缓存量化阶段围绕注意力 logits 和时空 token 选择进行设计。

这项工作带来的启示是,视频模型的缓存压缩不能只看逐元素误差或单一视觉指标。对于具有长时序依赖的生成系统,注意力结构本身可能比缓存数值的平均精度更重要。若能在低比特表示下稳定保留 token 选择,模型就有机会在降低内存压力的同时维持跨帧连贯性。

当然,现有素材主要介绍了方法动机与模块设计,尚未提供完整实验表格、具体压缩收益或不同模型上的对比细节。因此,QuantWM 的实际部署优势仍需结合论文完整结果进一步判断。不过,它明确指出了视频世界模型量化中的关键矛盾:误差最小的缓存并不一定带来最稳定的视频,而保持注意力路径可能才是控制闪烁的关键。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章