返回文章列表
扩散模型

MC-Sparse:让扩散Transformer的稀疏注意力更接近全注意力

阅读约 2 分钟

长序列生成正在把扩散Transformer的注意力计算推向瓶颈。视频生成和高分辨率3D资产生成尤其如此:序列中的token数量不断增加,而全注意力需要计算大规模的查询—键值交互。稀疏注意力因此成为降低延迟的重要路径,但“跳过更多token”并不等于免费提速。稀疏率升高后,生成结果可能出现质量和细节保真度下降。

MC-Sparse的工作重点,不只是提出一个新的稀疏模式,而是先分析稀疏注意力为何会偏离全注意力。论文通过受控的oracle对比,将误差归纳为三个来源:查询被迫进行粗粒度分组,导致本不相同的查询共享选择结果;负责筛选交互的机制不够准确,可能遗漏真正重要的KV token;被删除token原本贡献的注意力输出没有得到补偿。这种拆解为后续设计提供了更清晰的目标。

核心方法可以概括为三步:

  • 细粒度选择KV token:MC-Sparse不再完全依赖固定的token块,而是依据精确注意力概率选择单个键值token,以减少无关交互和误删重要信息的情况。
  • 兼顾GPU执行效率:查询侧仍会把相似查询组织成与计算tile对齐的分组。这样既保留较细的KV选择粒度,也避免完全不规则的稀疏访问破坏硬件并行效率。
  • 缓存被稀疏化丢失的信息:框架缓存查询分组、选中的KV索引,以及全注意力输出与稀疏输出之间的残差,并在后续去噪步骤中复用这些元数据,降低重复决策成本。

MC-Sparse是一个无需重新训练模型的框架,目标是让稀疏注意力输出更贴近全注意力,而非仅追求理论上的计算削减。论文在视频和3D生成模型上的结果显示,它相较已有稀疏注意力基线能够获得更高的全注意力保真度和更大的去噪加速;相对全注意力,Minimax-H3-Base的去噪速度提升为1.80倍,3D资产生成则达到2.32倍,且质量损失可忽略。

这项工作的意义在于,它把稀疏注意力的优化从“设计一种更激进的掩码”推进到“同时处理选择误差、硬件执行和信息补偿”。不过,摘要提供的结果主要集中在特定视频与3D生成模型,实际收益仍可能受到序列长度、稀疏率、GPU实现和缓存开销影响。总体而言,MC-Sparse为训练后扩散加速提供了一条兼顾精度与效率的技术路线。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章