記事一覧へ戻る
視覚・動画

SANA-Video 2.0:混合注意機構で高解像度動画生成を高速化

読了目安 3 分

導入

動画生成モデルでは、解像度、フレーム数、時間長が伸びるほど attention の計算コストが急増します。特に full-softmax 型の動画 Diffusion Transformer は表現力が高い一方で、長いシーケンスに対して重くなりやすいという課題があります。

SANA-Video 2.0 は、この問題に対して attention 構造そのものを再設計したモデルです。5B と 14B の 2 つの規模が同一アーキテクチャで提示され、単一 GPU 上で最大 720p の高品質動画生成を目指しています。ポイントは、線形注意のスケーラビリティを保ちつつ、必要な箇所で softmax 注意を挿入する点にあります。

主要ポイント

  • Hybrid Linear-Softmax Attention:すべての層で二次計算量の softmax attention を使うのではなく、大部分を gated linear attention に置き換えます。そのうえで、3:1 の比率で gated-softmax anchor を周期的に配置します。これにより、純粋な線形注意では不足しやすい全ランクの token 間相互作用を回復する狙いがあります。
  • Block Attention Residuals(AttnRes):softmax anchor で更新された表現を、その場限りで終わらせないための仕組みです。完了したブロックの要約を後続の線形層へ渡すことで、anchor 特徴を再利用します。論文では、深い層の有効ランクが約 12% 向上したとされています。
  • 最初からハイブリッド構造で学習:既存の softmax モデルを後から線形化するのではなく、SANA-Video 2.0 はハイブリッド構造を前提にゼロから学習されています。これにより、モデルは混合 attention の使い方を直接獲得します。
  • 25% softmax という設計判断:低解像度の代理実験により、品質と効率のバランスとして 25% softmax が適切だと示されています。これは、3:1 の線形 attention と softmax anchor の比率につながっています。
  • 報告された性能:40 ステップサンプリングでは、単一 H100 上の 480p 生成で VBench 84.30、13.2 秒を達成したとされています。また 720p/60s 設定では、コンパイル済み DiT forward が対応する full-softmax ベースラインより 3.2 倍高速で、動画時間が長いほど差が広がると報告されています。
  • Sol-Engine による追加高速化:kernel fusion、キャッシュ、sparse attention を含む Sol-Engine 最適化により、さらに 3.58 倍の高速化が得られたとされています。5B パイプラインは 720p/5s で 13.06 秒に達し、単一 H100 上で Wan 2.2-A14B より 120 倍高速だと述べられています。

意義と影響

SANA-Video 2.0 の意義は、単に高速な動画生成を示したことだけではありません。full-softmax の表現力と線形注意の効率性の間に、実用的な中間解を提示している点が重要です。少数の softmax anchor でグローバルな相互作用を補い、その特徴を AttnRes で深い層へ伝える構成は、長尺・高解像度動画生成に向いた設計と言えます。

今後、同様の結果が幅広い条件で再現されれば、動画生成モデルの競争軸は単なるパラメータ数から、attention 設計、学習方法、推論最適化を含む総合的なシステム設計へさらに移っていくでしょう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Self Gradient Forcing:長尺動画生成の「記憶の書き込み」を訓練する
視覚・動画
cctest.ai
視覚・動画

Self Gradient Forcing:長尺動画生成の「記憶の書き込み」を訓練する

Self Gradient Forcing は、自回帰型動画拡散モデルで見落とされがちな履歴コンテキストの勾配不足に焦点を当てる手法です。未来フレームの損失を、過去に生成した潜在表現をより有用な KV メモリへ書き込む学習信号として使います。

続きを読む
CCTest · Blog
TimeLens2:動画MLLMに「根拠がいつ起きたか」を示させる
視覚・動画
cctest.ai
視覚・動画

TimeLens2:動画MLLMに「根拠がいつ起きたか」を示させる

TimeLens2 は、動画の時間的グラウンディングを可変数の区間集合として扱い、モデルが出来事だけでなく根拠となる時間帯も示せるようにする研究です。2B、4B、8B の各モデルは Qwen3-VL バックボーンから大きな改善を示しています。

続きを読む