1枚の画像から実行可能な世界へ:RCWMが再帰的に3Dシーンを構築
導入
1枚の画像を、移動や編集が可能な3D世界へ変換するには、物体を認識して配置するだけでは不十分です。システムは、物体の大きさ、遮蔽、境界、カメラの投影、さらに物体同士の空間的な関係まで整合させる必要があります。Recursive Code World Models(RCWM)は、この構築過程そのものを再設計し、単一画像から実行可能なコードとして複雑な世界を組み立てます。
中核となる「全体・局所・全体」
RCWMは、主に2つの要素から構成されます。1つ目はRecursive Scene Program(RSP)です。RSPは、シーンを構成的なプログラムとして表現します。最終形状だけを出力するのではなく、世界の階層構造をコードとして保持するため、後から編集したり、さらに推論したりできます。
2つ目は、同じ処理を再帰的に呼び出す構築ソルバーです。1回の呼び出しは、次の流れで進みます。
- まず全体を定める:大まかなレイアウト、カメラ投影、主要な空間関係を設定する。
- 次に局所を再構成する:未解決の領域や物体へ再帰的に降り、対応するコードを観察・生成・編集する。
- 最後に親へ戻る:局所結果を大きなシーンへ戻し、境界、相対位置、複数部分に共通する誤差を見直す。
重要なのは、単に処理回数を増やすことではありません。局所構造には固有の認識と編集のループを与えつつ、全体の幾何や関係性から離れないようにする点にあります。参照画像に合わせたビューは各階層へ共有され、局所処理でも同一のカメラ投影を利用します。
視覚言語コーディングエージェントの役割
RCWMでは、視覚言語コーディングエージェントが参照画像と現在のシーンレンダリングを直接比較します。その結果に応じて、コードを修正するのか、より小さな問題へ再帰的に進むのか、親のシーンへ戻るのかを判断します。つまり、エージェントは最初にプログラムを一度生成するだけではなく、構築全体を反復的に導きます。
局所部分を精密化した後に、物体同士の接続や配置のずれ、複数部分に共通する誤差が初めて見えることがあります。親シーンへの再訪は、こうした問題を全体の文脈で修正するための仕組みです。
意義と限界
RCWMは、世界モデルを一度に生成するのではなく、再帰的に展開・編集・再統合されるプログラムとして捉えます。編集可能なアセット、シミュレーション、将来のインタラクションを想定する場合、実行可能で階層的な表現は静的な再構成より拡張性を持つ可能性があります。
提供された概要によれば、RCWMは複雑なシーンで従来のコードベース画像・シーン再構成手法を上回りました。アブレーションも再帰構築の有効性を支持し、より深い呼び出しが細かな構造の復元に役立つ可能性を示します。ただし、具体的な数値、ベンチマーク、計算コストは素材に含まれていません。そのため、現時点では単一画像3D再構成を完全に解決した手法というより、実験に支えられた構築原理として評価するのが適切です。
コメント
ログイン状態を確認中…
コメントを読み込み中…