WorldCrafter、暗黙的3Dメモリで動画世界の一貫性を向上
背景
動画世界モデルに求められるのは、見栄えのよい短い動画を生成することだけではない。ユーザーがカメラを動かしながら環境を探索する場合、いったん画面外に出た建物や物体も、別の視点から再び見たときに同じものとして存在している必要がある。しかし従来のモデルでは、生成が長くなったり視点が変わったりすると、物体の位置や形状が変化し、同じ空間を継続しているように見えなくなることがある。
Tencent ARCが提案するWorldCrafterは、この課題を過去の観測をどう記憶するかという問題として捉え、カメラから問い合わせ可能な暗黙的3D対応メモリを導入した。
主な仕組み
- 要求された視点に応じて記憶を読む。 過去のフレームをすべて同じように利用するのではなく、次に指定されたカメラ視点に関係する多視点情報を選び出す。
- 限られたトークン数に圧縮する。 メモリエンコーダと姿勢条件付きの読み出しモジュールが、過去の観測を目標視点に対応した固定数のトークンへ変換し、動画生成のノイズ除去前に注入する。
- 明示的な深度対応を避ける。 観測間の深度ベースの対応関係を直接構築するのではなく、メモリ部分と動画生成器を共同学習し、多視点情報の保存と再利用方法を暗黙的に学習する。
- 長期記憶と直近の文脈を統合する。 メモリは長時間のシーン整合性を支え、最近の時系列情報は局所的な動きや外観の連続性を補う。少ステップ蒸留により、ストリーミング探索も意識した生成を実現する。
WorldCrafterは、1枚の画像またはテキストプロンプトから探索を開始し、新しい観測を受け取るたびに記憶を更新できる。これは固定長の動画を一度だけ生成する仕組みよりも、状態を保ちながら変化する環境モデルに近い設計だ。
意義と今後
この研究の重要な点は、動画モデルの記憶を単純な履歴の蓄積として扱っていないことである。これから見る視点を手がかりに、履歴のどの情報を圧縮し、生成器へ渡すべきかを決める。これにより、コンテキスト容量の制約とカメラ制御の要件を同時に扱おうとしている。
論文によれば、静的・動的シーンの実験で、長時間の一貫性とカメラ制御精度が向上し、分単位の探索でも視覚品質が維持された。インタラクティブ動画、仮想環境、ゲーム制作、具身エージェントのシミュレーションへの応用が期待できる。一方、提示された素材には詳細なベンチマーク数値が含まれていないため、複雑な相互作用や実環境での汎化は今後の検証課題である。
コメント
ログイン状態を確認中…
コメントを読み込み中…