返回文章列表
视觉与视频

SparsePR:用“分区+残差重建”加速视频生成注意力

阅读约 2 分钟

视频生成模型和世界模型通常需要处理很长的时空序列,注意力层因此成为推理阶段的重要计算瓶颈。块稀疏注意力可以减少查询与键之间的交互,但“哪些块应该保留”并不是一个简单的排序问题:即使单个查询的注意力高度集中,被分到同一块的其他查询也可能关注完全不同的位置;而保留较高的注意力质量,也不能直接说明跳过交互后,softmax输出会产生多大误差。

SparsePR的核心思路是把稀疏注意力拆成两个环节:先改进分区,再补偿被跳过的部分。

  • 响应耦合分区:方法从一小批采样查询出发,观察它们对键的响应,并将成对的键和值组织成K/V组。随后利用这些响应形成的质心,建立面向查询响应的坐标,从而让共享同一路由的查询在“实际响应模式”上更加接近,而不只是依赖原始位置或单一的注意力分数。
  • 探针拟合残差:系统选取少量查询行执行精确注意力,将完整结果与稀疏结果之间的差异视为探针残差。SparsePR据此拟合一次面向当前调用的仿射修正,并将修正限制在探针残差实际观测到的输出子空间内,再用于估计其他查询被跳过的贡献。
  • 面向执行的设计:与只报告保留注意力质量不同,SparsePR直接关注稀疏输出的重建误差,并配合块稀疏GPU实现,试图把算法层面的稀疏率转化为真实的端到端收益。

论文在HunyuanVideo、Wan2.2、Cosmos2.5和Cosmos3-Nano四个异构视频生成与世界模型上进行评估。结果显示,在实际执行的查询—键对密度为22.0%至26.0%时,SparsePR仍能保持生成质量,同时取得1.48至2.61倍的端到端加速。消融结果还表明,探针拟合对误差下降贡献最大;响应耦合分区则主要降低直接丢弃交互时的误差,并在探针数量受限时改善重建效果。

这项工作的意义在于,它把训练免费稀疏注意力从“预测重要块”推进到“估计跳过后的输出”。对于视频扩散和世界模型而言,真正的瓶颈不仅是注意力矩阵有多稀疏,还包括稀疏近似是否能稳定映射回完整输出。SparsePR提供了一种调用级校准思路:不改变模型参数,只用少量精确计算学习当前注意力调用的误差结构。其效果仍取决于探针预算、分区质量和硬件执行效率,但这一框架为长时空生成模型的推理加速提供了较明确的工程路径。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章