HLA-WM、長期動画世界モデルの忘却をアドレス可能な記憶で抑制
導入
長期の動画世界モデルに求められるのは、各フレームを自然に生成することだけではない。長いロールアウトの間、物体の位置やシーンの構造、カメラの移動を保持し、以前に訪れた場所へ戻ったときにも同じ世界として描ける必要がある。過去の情報を呼び戻せなければ、視点のずれ、物体の不整合、カメラ制御の誤差が生じやすい。
論文「HLA-WM」は、この課題に対して追加学習を必要としないハイブリッド線形注意の仕組みを提案する。完全なKVキャッシュの高いメモリコストと、再帰的線形注意が抱える長期忘却の間を埋めることが狙いだ。
核心となる仕組み
- 二つの注意方式の弱点を補う。 Softmax注意は生成履歴をKVキャッシュとして保持するため参照性に優れるが、履歴が増えるほどメモリを消費する。一方、Gated DeltaNet(GDN)は固定サイズの状態に圧縮できるものの、後続の更新によって遠い過去の重要情報が徐々に弱くなる。
- 履歴をチャンク化する。 HLA-WMはGDNのアフィン構造を利用し、時間方向に分割した各チャンクの遷移要約を小さく保存する。
- カメラ幾何を記憶のアドレスにする。 新しいフレームを生成する際、現在のカメラ視点と幾何的に関連する過去チャンクを検索する。これにより、すべての履歴を同じ強さで保持するのではなく、再訪に必要な情報を選択できる。
- 現在のクエリ向けに状態を再構成する。 検索した履歴を単純に連結するのではなく、現在の問い合わせに対応する再帰的線形状態へ組み直す。
- 整合性と制御の双方で改善を報告する。 60秒のSANA-WM-Benchでは、基盤となる自己回帰生成器の6つの総合指標をすべて改善した。PSNRは0.74 dB向上し、回転誤差は28.5%低下した。下流の精細化後も効果は維持され、MBench-Aでも547サンプル、4サブセット、評価対象の全推論モードで3つの再訪整合性指標を改善した。
- 効率面の負担は小さい。 60秒の文脈では、完全なKVキャッシュに比べて過去状態のメモリを12分の1に削減し、推論スループットの低下は最大1.6%だった。
意義と限界
HLA-WMが示す重要な方向性は、長期記憶を「すべて保存する」か「固定状態に完全圧縮する」かの二択にしないことだ。カメラ制御動画では、幾何情報を記憶の検索キーとして利用できるため、線形注意の効率を保ちながら、必要な過去だけを読み戻せる。
この設計は、同じ場所への再訪や長いカメラ軌道を扱う世界モデルに適している。一方、結果は評価された基盤モデル、データセット、検索方式に依存しており、幾何マッチングやチャンク要約の品質が別環境での性能を左右する可能性がある。それでも、追加学習や単純なモデル大型化ではなく、推論時の記憶整理によって有効な時間範囲を伸ばす実践的な例といえる。
コメント
ログイン状態を確認中…
コメントを読み込み中…