記事一覧へ戻る
世界モデル

LOCI、映像世界モデルに「再訪する場所」の空間記憶を導入

読了目安 3 分

導入

映像世界モデルに求められるのは、次のフレームを生成することだけではありません。カメラがある場所を撮影した後に別の方向へ向き、しばらくして同じ場所へ戻ったとき、そこに以前存在した物体や配置、視覚的な細部まで一貫して再現する必要があります。しかし、長い履歴を保存するほどメモリは増え、履歴を小さな状態へ圧縮するほど個々の観測を直接取り出しにくくなります。

LOCIは、この二つの記憶方式を組み合わせることで、長時間のストリーミング処理に対応しようとするアーキテクチャです。

二つの記憶を使い分ける設計

LOCIでは、Transformerのブロックを異なる役割に分けます。

  • 半分のブロックは、過去の観測をキー・バリューキャッシュとして保持します。保存された情報へ直接アクセスできるため、映像の細部を維持しやすい一方、履歴が長くなるほどメモリ使用量が増えます。
  • 残りのブロックは注意の範囲を現在のチャンクに限定し、再帰的な線形注意メモリを追加します。これは履歴をコンパクトな状態として更新し続ける仕組みです。
  • メモリの読み出しと書き込みには、カメラの投影幾何が使われます。現在の視点を考慮して、どの場所に観測を格納し、どの過去情報を参照するかを判断します。
  • 再帰メモリからの読み出しは、後段のキャッシュ利用ブロックへ渡されます。これにより、詳細な検索を行うクエリに、蓄積されたシーンの文脈が加わります。

つまり、LOCIは高精細な証拠の保持と、長期的な文脈の圧縮を一つの機構に押し込めません。キャッシュは直接参照できる過去情報を担い、線形メモリは継続的な文脈を担います。さらにカメラ幾何によって、現在の視点に合う記憶へアクセスしやすくする構成です。

報告された評価

素材によると、LOCIは公開のMIND memory benchmarkと、Unreal Engineで記録したホールドアウト軌跡で評価されました。再訪シーンのテストでは、代表的な世界モデルや同じ設計方針を用いたフルSoftmaxのベースラインより、過去の内容を忠実に再現したとされています。

全履歴を保持する設定では、同じ系列長におけるピークメモリをフルSoftmax比で約30%削減しました。また、保持する観測の数に上限を設けた場合でも、長い動画を一定メモリでストリーミングでき、同じ予算内でフルSoftmaxより高い再現性を維持したと報告されています。

意義と今後の論点

LOCIは、長期的な整合性が重要な映像生成やインタラクティブな環境シミュレーションに向けた、実用的な折衷案を示します。詳細を保存するキャッシュ、軽量な文脈を運ぶ線形メモリ、そして視点を記憶の検索に結び付ける幾何情報を組み合わせる点が特徴です。

一方、提供された素材だけでは、現実のカメラノイズ、複雑な動的環境、大規模モデルでの挙動までは判断できません。研究チームは、ゲームエンジン映像、正確なカメラ姿勢、深度、再訪ペアを含むLOCI-revisit-dataと、プロジェクトページおよびコードを公開しています。これらは世界モデルの記憶と一貫性を比較検証するための基盤になりそうです。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
World Observer、視野外の変化を追跡する世界モデル
世界モデル
cctest.ai
世界モデル

World Observer、視野外の変化を追跡する世界モデル

World Observerは、行動主体の視点と観測者の視点を分離し、複数の視点を同時に生成する手法です。物体が行動主体の視野を離れた後も観測者側で変化を続けさせ、再び視野に入った際の状態と外観の一貫性を高めます。

続きを読む
CCTest · Blog
AutoGUIWorld、画像生成モデルでGUIエージェントの世界をシミュレーション
世界モデル
cctest.ai
世界モデル

AutoGUIWorld、画像生成モデルでGUIエージェントの世界をシミュレーション

AutoGUIWorldは、画像生成モデルの視覚的な事前知識とタスクプランナーを組み合わせ、実際のソフトウェアを起動せずにGUI操作軌跡を合成する。複数のOSやブラウザを対象としたデータで、コンピュータ操作エージェントの性能向上を検証した。

続きを読む
CCTest · Blog
Physis-Lang:進化する物理言語で動画世界モデルを改善
世界モデル
cctest.ai
世界モデル

Physis-Lang:進化する物理言語で動画世界モデルを改善

NVIDIAの研究チームは、物体や因果関係、相互作用、時間変化を記述する物理言語を、動画の収集・学習・生成に共通する表現として扱うPhysis-Langを提案しました。原子レベルの断言評価と言語誘導検索により、物理的に妥当な動画生成を目指します。

続きを読む