QuantWM、動画世界モデルの2ビットKVキャッシュ量子化で注意機構を維持
動画世界モデルは、生成済みのフレームに含まれる時間的・空間的情報を後続の生成で参照するため、Key-Value(KV)キャッシュを保持します。これにより長い時間範囲での一貫性を支えられる一方、生成が進むほどキャッシュのサイズは大きくなり、推論時のメモリ使用量が大きな課題になります。そこで2ビット量子化による圧縮が考えられますが、一般的な評価指標でほぼ無損失に見える既存手法でも、動画世界モデルでは時間方向のちらつきや画質低下が起こる場合があります。
QuantWMの特徴は、問題を単純な数値再構成誤差の削減として扱わず、注意の挙動を保つ問題として捉えた点です。論文の分析では、Keyの再構成誤差はValueより小さいにもかかわらず、出力の劣化はKey量子化の方が大きくなることがあります。
この差はKeyが注意機構で果たす役割に関係します。Keyが量子化によって変化すると、Queryとの組み合わせで計算される注意ロジットも変化します。その結果、モデルが時間方向・空間方向のどのtokenを参照するかがずれ、フレーム間の内容の連続性が崩れる可能性があります。つまり、各キャッシュ要素を平均的に元の値へ近づけるだけでは不十分で、モデルが選ぶ参照先を維持することが重要になります。
QuantWMは次の2つの技術を組み合わせます。
- 量子化感度を考慮したクラスタリング(QSAC):過去のQueryが各チャネルにどの程度敏感か、また残差の範囲がどの程度かを共同で考慮し、INT2に適したKeyのクラスタ中心を選びます。注意に重要なチャネルの量子化誤差を抑える狙いです。
- 主部分空間での注意補償(PSAC):量子化後に残るKeyの誤差を、Queryの支配的な部分空間に沿って補償し、変化した注意関係の回復を目指します。
- 追加学習なし:新たな学習段階を必要としない量子化フレームワークとして設計されています。
この研究が示すのは、動画生成のキャッシュ圧縮ではテンソル単位の誤差だけでなく、モデルの行動を評価すべきだということです。平均的な再構成誤差が小さくてもtokenの選択が変われば動画は不安定になります。逆に、注意の経路を保てれば、低ビット表現でも時間的一貫性を維持できる可能性があります。
提供された素材には、完全な実験表、具体的なメモリ削減量、複数モデルでの詳細比較は含まれていません。そのため、実運用上の優位性は論文全体の結果を確認する必要があります。それでもQuantWMは、動画世界モデルの効率化において「値を近づけること」だけでなく「参照するtokenを守ること」が重要だと明確に示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…