返回文章列表
视觉与视频

SANA-Video 2.0:用混合注意力加速高分辨率视频生成

阅读约 3 分钟

导语

视频生成模型的主要瓶颈之一,是长序列带来的注意力计算成本。分辨率、帧数和时长一旦上升,传统 full-softmax 视频 DiT 的开销会迅速膨胀。SANA-Video 2.0 的目标,是在不完全牺牲生成质量的前提下,让高分辨率、较长时长的视频生成更接近单卡可用。

这项工作来自 NVIDIA 相关团队,模型在统一架构下提供 5B 和 14B 两个规模。论文强调,它不是把已有 softmax 模型事后“线性化”,而是从零开始训练整个混合结构,让模型直接适应新的注意力组合方式。

核心要点

  • 混合线性与 softmax 注意力:SANA-Video 2.0 没有在所有层都使用二次复杂度的 softmax 注意力,而是采用 Hybrid Linear-Softmax Attention。大部分计算由 gated linear attention 承担,以获得更接近 O(N) 的长序列扩展性;同时按 3:1 的比例周期性插入 gated-softmax anchor,用来补足纯线性注意力缺少的全秩 token 交互能力。
  • AttnRes 复用深层特征:论文提出 Block Attention Residuals,将已完成块的摘要信息路由到后续线性层。这样,softmax anchor 产生的“刷新后”表示不会只在局部生效,而能在更深层继续被利用。作者报告,这一设计让深层有效秩提升约 12%。
  • 25% softmax 的折中选择:通过低分辨率代理实验,研究者认为 25% softmax 是质量与效率之间较合适的平衡点,也就是既避免全程 quadratic attention,又不让纯线性注意力带来明显表达力损失。
  • 单卡性能数据:在 40 步采样下,SANA-Video 2.0 在单张 H100 上生成 480p 视频的 VBench 得分为 84.30,用时 13.2 秒。其编译后的 DiT forward 在 720p/60s 设置下,比匹配的 full-softmax 基线快 3.2 倍,且时长越长差距越明显。
  • 系统级优化继续放大优势:结合 Sol-Engine 的 kernel fusion、缓存和稀疏注意力后,硬件友好的模型骨架又获得 3.58 倍加速。论文称 5B 管线在 720p/5s 上达到 13.06 秒,并在单张 H100 上比 Wan 2.2-A14B 快 120 倍。

意义与影响

SANA-Video 2.0 的价值不只在于“更快”,而在于提供了一条视频 DiT 扩展的新思路:不必在全 softmax 的高表达力和线性注意力的低成本之间二选一,而是通过少量高质量锚点维持全局交互,再让线性层负责大规模传播。

如果论文中的结果能在更多场景中复现,这类混合注意力结构可能会成为长视频、高分辨率生成的重要方向。它也提示行业:视频生成的竞争不只是模型参数规模,还包括注意力结构、训练方式和推理系统优化的整体协同。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Self Gradient Forcing:让自回归视频模型学会写好长期记忆
视觉与视频
cctest.ai
视觉与视频

Self Gradient Forcing:让自回归视频模型学会写好长期记忆

Self Gradient Forcing 针对自回归视频扩散模型中的“历史上下文梯度缺口”,尝试让未来帧的损失反向监督早期生成内容如何写入更有用的 KV 记忆。该方法以两阶段训练在不完整回传长序列 rollout 的前提下,提升长视频外推的一致性。

阅读全文