WorldRover、探索可能な世界モデル向けの豊富な合成動画を生成
導入
探索可能な世界を理解・生成・再構成するモデルには、RGB 動画だけでは不十分です。カメラがどのように動いたか、シーンの形状がどの程度一貫しているか、時間をまたいで同じ点や物体をどう対応付けるか、さらに観測と行動をどう結び付けるかが必要になります。実環境の撮影では、これらの情報を同時に取得することは難しく、密な幾何や長距離の対応関係は推定処理や専用機器に依存しがちです。
WorldRover は、こうした教師信号をレンダリング時に用意するアプローチです。中核となる WorldRover-Engine は Unreal Engine 上で動作し、アーティスト制作の環境内で分単位の探索経路を実行してオフラインレンダリングします。経路、カメラ運動、シーン形状をエンジン側で保持するため、同じ探索に対して複数の注釈を整合的に付与できます。
主なポイント
- RGB と幾何情報の同期:WorldRover-10M は、RGB にメトリック深度、カメラ軌跡、軌跡から導出した行動信号を対応付けます。
- 長時間の探索:完全な経路を保存するため、独立した短いクリップだけでなく、持続的なナビゲーションやシーン記憶の研究に利用できます。
- 複数視点への再生:同じ移動を一人称、三人称、360度パノラマの各カメラから描画できます。
- 三人称向けの追加注釈:一部データには密な光フロー、可視性付きの長距離2D/3D点軌跡、カメラとは異なるキャラクター軌跡が含まれます。
- 外観の制御:経路と形状を保ったまま環境状態を変更したり、中立的な白色マテリアルに置き換えたりできます。
意義と課題
WorldRover の意義は、動画の量だけを増やすことではありません。探索を再現・再生可能なデータ生成単位として扱い、観測、空間構造、時間的対応、行動関連信号を同じ過程から得られる点にあります。視点や環境状態を変えた同一経路を比較できるため、条件をそろえた検証にも向いています。
一方、合成環境が現実世界をそのまま代替するわけではありません。アーティスト制作のシーンやエンジン内の変化が、実環境の複雑な揺らぎをどこまで表現できるかは、今後の検証が必要です。現時点では、密な注釈の取得コストを下げ、探索可能な世界表現を開発・評価する共通基盤として、実データを補完する位置付けが妥当でしょう。
コメント
ログイン状態を確認中…
コメントを読み込み中…