記事一覧へ戻る
世界モデル

QuantWM、動画世界モデルの2ビットKVキャッシュ量子化で注意機構を維持

読了目安 3 分

動画世界モデルは、生成済みのフレームに含まれる時間的・空間的情報を後続の生成で参照するため、Key-Value(KV)キャッシュを保持します。これにより長い時間範囲での一貫性を支えられる一方、生成が進むほどキャッシュのサイズは大きくなり、推論時のメモリ使用量が大きな課題になります。そこで2ビット量子化による圧縮が考えられますが、一般的な評価指標でほぼ無損失に見える既存手法でも、動画世界モデルでは時間方向のちらつきや画質低下が起こる場合があります。

QuantWMの特徴は、問題を単純な数値再構成誤差の削減として扱わず、注意の挙動を保つ問題として捉えた点です。論文の分析では、Keyの再構成誤差はValueより小さいにもかかわらず、出力の劣化はKey量子化の方が大きくなることがあります。

この差はKeyが注意機構で果たす役割に関係します。Keyが量子化によって変化すると、Queryとの組み合わせで計算される注意ロジットも変化します。その結果、モデルが時間方向・空間方向のどのtokenを参照するかがずれ、フレーム間の内容の連続性が崩れる可能性があります。つまり、各キャッシュ要素を平均的に元の値へ近づけるだけでは不十分で、モデルが選ぶ参照先を維持することが重要になります。

QuantWMは次の2つの技術を組み合わせます。

  • 量子化感度を考慮したクラスタリング(QSAC):過去のQueryが各チャネルにどの程度敏感か、また残差の範囲がどの程度かを共同で考慮し、INT2に適したKeyのクラスタ中心を選びます。注意に重要なチャネルの量子化誤差を抑える狙いです。
  • 主部分空間での注意補償(PSAC):量子化後に残るKeyの誤差を、Queryの支配的な部分空間に沿って補償し、変化した注意関係の回復を目指します。
  • 追加学習なし:新たな学習段階を必要としない量子化フレームワークとして設計されています。

この研究が示すのは、動画生成のキャッシュ圧縮ではテンソル単位の誤差だけでなく、モデルの行動を評価すべきだということです。平均的な再構成誤差が小さくてもtokenの選択が変われば動画は不安定になります。逆に、注意の経路を保てれば、低ビット表現でも時間的一貫性を維持できる可能性があります。

提供された素材には、完全な実験表、具体的なメモリ削減量、複数モデルでの詳細比較は含まれていません。そのため、実運用上の優位性は論文全体の結果を確認する必要があります。それでもQuantWMは、動画世界モデルの効率化において「値を近づけること」だけでなく「参照するtokenを守ること」が重要だと明確に示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
RealtimeWAM:世界行動モデルを1ステップ・非同期推論へ
世界モデル
cctest.ai
世界モデル

RealtimeWAM:世界行動モデルを1ステップ・非同期推論へ

RealtimeWAMは、世界行動モデルにおける多段階の行動デノイズと、動画エキスパートと行動エキスパート間の待ち時間を同時に削減する。論文では、H100上で最大25倍のエンドツーエンド高速化と、1%未満の精度低下が報告されている。

続きを読む
CCTest · Blog
JEPA-TTT、世界モデルをテスト時に継続適応させる
世界モデル
cctest.ai
世界モデル

JEPA-TTT、世界モデルをテスト時に継続適応させる

JEPA-TTTは、学習時と異なる環境ダイナミクスに直面した際、事前学習済みJEPA世界モデルを運用中に適応させる手法です。視覚表現と報酬ヘッドを固定し、潜在ダイナミクス予測器だけを自己教師ありで更新します。

続きを読む
CCTest · Blog
ProWAM、段階的な視覚サブゴールでロボットの長期制御を支援
世界モデル
cctest.ai
世界モデル

ProWAM、段階的な視覚サブゴールでロボットの長期制御を支援

ProWAMは、世界行動モデルに順序付きの疎な視覚サブゴールを導入し、未来の動画全体を生成せずにロボットへ中間目標を与える。複数のシミュレーション評価で、分布外環境に対する頑健性の向上が報告された。

続きを読む