SparsePR、分割と残差再構成で動画生成の注意機構を高速化
動画生成モデルや世界モデルでは、長い時空間系列を扱うため、注意機構が推論コストの大きな部分を占めます。ブロック疎注意はクエリとキーの相互作用を減らせますが、どのブロックを残すかは単純なランキングでは決まりません。同じルートに割り当てられたクエリでも、実際に注目する位置が大きく異なる可能性があります。また、保持した注意質量だけでは、softmax後に省略した相互作用がどれほど出力誤差を生むかを判断できません。
SparsePRは、この問題を「分割の改善」と「省略された残差の再構成」に分けて扱います。
- 応答結合型パーティショニング:サンプリングしたクエリがキーに対して示す応答を調べ、キーと値を対応づけたK/Vグループを構成します。その応答の重心からクエリ応答座標を作り、位置だけではなく、実際の応答パターンが近いクエリを共有ルートに集めます。
- プローブ適合型残差再構成:少数のクエリ行について厳密な注意計算を行い、厳密出力と疎出力の差をプローブ残差として取得します。SparsePRはそこから呼び出しごとのアフィン補正を学習し、観測された残差の出力部分空間に限定して他のクエリを補正します。
- 実行可能性の重視:保持された注意質量だけでなく、注意出力の再構成誤差を直接評価し、ブロック疎なGPU実装によって実際の速度向上につなげる設計です。
評価対象はHunyuanVideo、Wan2.2、Cosmos2.5、Cosmos3-Nanoの4モデルです。実際に実行するクエリ・キー対の密度を22.0〜26.0%に抑えた場合でも生成品質を維持し、エンドツーエンドで1.48〜2.61倍の高速化を達成したと報告されています。アブレーションでは、誤差低減の大部分をプローブ適合が担い、応答結合型パーティショニングは単純に相互作用を落とす場合の誤差を抑え、プローブ数が限られる条件で再構成を改善しました。
この研究の意義は、再学習なしの疎注意を「重要ブロックの選択」だけでなく、「省略したブロックの出力への影響の推定」として捉え直した点にあります。モデルのパラメータを変更せず、少量の厳密計算からその時点の注意呼び出しに固有な残差構造を推定するため、長い時空間コンテキストの推論高速化に向けた実装上の道筋を示しています。効果はプローブ予算、分割品質、GPUカーネル効率に左右されますが、動画生成と世界モデルの推論最適化に有用な枠組みです。
コメント
ログイン状態を確認中…
コメントを読み込み中…