LOCI、映像世界モデルに「再訪する場所」の空間記憶を導入
導入
映像世界モデルに求められるのは、次のフレームを生成することだけではありません。カメラがある場所を撮影した後に別の方向へ向き、しばらくして同じ場所へ戻ったとき、そこに以前存在した物体や配置、視覚的な細部まで一貫して再現する必要があります。しかし、長い履歴を保存するほどメモリは増え、履歴を小さな状態へ圧縮するほど個々の観測を直接取り出しにくくなります。
LOCIは、この二つの記憶方式を組み合わせることで、長時間のストリーミング処理に対応しようとするアーキテクチャです。
二つの記憶を使い分ける設計
LOCIでは、Transformerのブロックを異なる役割に分けます。
- 半分のブロックは、過去の観測をキー・バリューキャッシュとして保持します。保存された情報へ直接アクセスできるため、映像の細部を維持しやすい一方、履歴が長くなるほどメモリ使用量が増えます。
- 残りのブロックは注意の範囲を現在のチャンクに限定し、再帰的な線形注意メモリを追加します。これは履歴をコンパクトな状態として更新し続ける仕組みです。
- メモリの読み出しと書き込みには、カメラの投影幾何が使われます。現在の視点を考慮して、どの場所に観測を格納し、どの過去情報を参照するかを判断します。
- 再帰メモリからの読み出しは、後段のキャッシュ利用ブロックへ渡されます。これにより、詳細な検索を行うクエリに、蓄積されたシーンの文脈が加わります。
つまり、LOCIは高精細な証拠の保持と、長期的な文脈の圧縮を一つの機構に押し込めません。キャッシュは直接参照できる過去情報を担い、線形メモリは継続的な文脈を担います。さらにカメラ幾何によって、現在の視点に合う記憶へアクセスしやすくする構成です。
報告された評価
素材によると、LOCIは公開のMIND memory benchmarkと、Unreal Engineで記録したホールドアウト軌跡で評価されました。再訪シーンのテストでは、代表的な世界モデルや同じ設計方針を用いたフルSoftmaxのベースラインより、過去の内容を忠実に再現したとされています。
全履歴を保持する設定では、同じ系列長におけるピークメモリをフルSoftmax比で約30%削減しました。また、保持する観測の数に上限を設けた場合でも、長い動画を一定メモリでストリーミングでき、同じ予算内でフルSoftmaxより高い再現性を維持したと報告されています。
意義と今後の論点
LOCIは、長期的な整合性が重要な映像生成やインタラクティブな環境シミュレーションに向けた、実用的な折衷案を示します。詳細を保存するキャッシュ、軽量な文脈を運ぶ線形メモリ、そして視点を記憶の検索に結び付ける幾何情報を組み合わせる点が特徴です。
一方、提供された素材だけでは、現実のカメラノイズ、複雑な動的環境、大規模モデルでの挙動までは判断できません。研究チームは、ゲームエンジン映像、正確なカメラ姿勢、深度、再訪ペアを含むLOCI-revisit-dataと、プロジェクトページおよびコードを公開しています。これらは世界モデルの記憶と一貫性を比較検証するための基盤になりそうです。
コメント
ログイン状態を確認中…
コメントを読み込み中…