記事一覧へ戻る
世界モデル

WorldRover、探索可能な世界モデル向けの豊富な合成動画を生成

読了目安 3 分

導入

探索可能な世界を理解・生成・再構成するモデルには、RGB 動画だけでは不十分です。カメラがどのように動いたか、シーンの形状がどの程度一貫しているか、時間をまたいで同じ点や物体をどう対応付けるか、さらに観測と行動をどう結び付けるかが必要になります。実環境の撮影では、これらの情報を同時に取得することは難しく、密な幾何や長距離の対応関係は推定処理や専用機器に依存しがちです。

WorldRover は、こうした教師信号をレンダリング時に用意するアプローチです。中核となる WorldRover-Engine は Unreal Engine 上で動作し、アーティスト制作の環境内で分単位の探索経路を実行してオフラインレンダリングします。経路、カメラ運動、シーン形状をエンジン側で保持するため、同じ探索に対して複数の注釈を整合的に付与できます。

主なポイント

  • RGB と幾何情報の同期:WorldRover-10M は、RGB にメトリック深度、カメラ軌跡、軌跡から導出した行動信号を対応付けます。
  • 長時間の探索:完全な経路を保存するため、独立した短いクリップだけでなく、持続的なナビゲーションやシーン記憶の研究に利用できます。
  • 複数視点への再生:同じ移動を一人称、三人称、360度パノラマの各カメラから描画できます。
  • 三人称向けの追加注釈:一部データには密な光フロー、可視性付きの長距離2D/3D点軌跡、カメラとは異なるキャラクター軌跡が含まれます。
  • 外観の制御:経路と形状を保ったまま環境状態を変更したり、中立的な白色マテリアルに置き換えたりできます。

意義と課題

WorldRover の意義は、動画の量だけを増やすことではありません。探索を再現・再生可能なデータ生成単位として扱い、観測、空間構造、時間的対応、行動関連信号を同じ過程から得られる点にあります。視点や環境状態を変えた同一経路を比較できるため、条件をそろえた検証にも向いています。

一方、合成環境が現実世界をそのまま代替するわけではありません。アーティスト制作のシーンやエンジン内の変化が、実環境の複雑な揺らぎをどこまで表現できるかは、今後の検証が必要です。現時点では、密な注釈の取得コストを下げ、探索可能な世界表現を開発・評価する共通基盤として、実データを補完する位置付けが妥当でしょう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
World Observer、視野外の変化を追跡する世界モデル
世界モデル
cctest.ai
世界モデル

World Observer、視野外の変化を追跡する世界モデル

World Observerは、行動主体の視点と観測者の視点を分離し、複数の視点を同時に生成する手法です。物体が行動主体の視野を離れた後も観測者側で変化を続けさせ、再び視野に入った際の状態と外観の一貫性を高めます。

続きを読む
CCTest · Blog
AutoGUIWorld、画像生成モデルでGUIエージェントの世界をシミュレーション
世界モデル
cctest.ai
世界モデル

AutoGUIWorld、画像生成モデルでGUIエージェントの世界をシミュレーション

AutoGUIWorldは、画像生成モデルの視覚的な事前知識とタスクプランナーを組み合わせ、実際のソフトウェアを起動せずにGUI操作軌跡を合成する。複数のOSやブラウザを対象としたデータで、コンピュータ操作エージェントの性能向上を検証した。

続きを読む
CCTest · Blog
LOCI、映像世界モデルに「再訪する場所」の空間記憶を導入
世界モデル
cctest.ai
世界モデル

LOCI、映像世界モデルに「再訪する場所」の空間記憶を導入

LOCIは、キー・バリューキャッシュと再帰的な線形メモリを組み合わせ、カメラが過去に見た場所へ戻った際の映像再現性を高める手法です。カメラの投影幾何を記憶の読み書きに利用し、長い動画をより少ないメモリで処理します。

続きを読む