記事一覧へ戻る
世界モデル

1枚の画像から実行可能な世界へ:RCWMが再帰的に3Dシーンを構築

読了目安 3 分

導入

1枚の画像を、移動や編集が可能な3D世界へ変換するには、物体を認識して配置するだけでは不十分です。システムは、物体の大きさ、遮蔽、境界、カメラの投影、さらに物体同士の空間的な関係まで整合させる必要があります。Recursive Code World Models(RCWM)は、この構築過程そのものを再設計し、単一画像から実行可能なコードとして複雑な世界を組み立てます。

中核となる「全体・局所・全体」

RCWMは、主に2つの要素から構成されます。1つ目はRecursive Scene Program(RSP)です。RSPは、シーンを構成的なプログラムとして表現します。最終形状だけを出力するのではなく、世界の階層構造をコードとして保持するため、後から編集したり、さらに推論したりできます。

2つ目は、同じ処理を再帰的に呼び出す構築ソルバーです。1回の呼び出しは、次の流れで進みます。

  • まず全体を定める:大まかなレイアウト、カメラ投影、主要な空間関係を設定する。
  • 次に局所を再構成する:未解決の領域や物体へ再帰的に降り、対応するコードを観察・生成・編集する。
  • 最後に親へ戻る:局所結果を大きなシーンへ戻し、境界、相対位置、複数部分に共通する誤差を見直す。

重要なのは、単に処理回数を増やすことではありません。局所構造には固有の認識と編集のループを与えつつ、全体の幾何や関係性から離れないようにする点にあります。参照画像に合わせたビューは各階層へ共有され、局所処理でも同一のカメラ投影を利用します。

視覚言語コーディングエージェントの役割

RCWMでは、視覚言語コーディングエージェントが参照画像と現在のシーンレンダリングを直接比較します。その結果に応じて、コードを修正するのか、より小さな問題へ再帰的に進むのか、親のシーンへ戻るのかを判断します。つまり、エージェントは最初にプログラムを一度生成するだけではなく、構築全体を反復的に導きます。

局所部分を精密化した後に、物体同士の接続や配置のずれ、複数部分に共通する誤差が初めて見えることがあります。親シーンへの再訪は、こうした問題を全体の文脈で修正するための仕組みです。

意義と限界

RCWMは、世界モデルを一度に生成するのではなく、再帰的に展開・編集・再統合されるプログラムとして捉えます。編集可能なアセット、シミュレーション、将来のインタラクションを想定する場合、実行可能で階層的な表現は静的な再構成より拡張性を持つ可能性があります。

提供された概要によれば、RCWMは複雑なシーンで従来のコードベース画像・シーン再構成手法を上回りました。アブレーションも再帰構築の有効性を支持し、より深い呼び出しが細かな構造の復元に役立つ可能性を示します。ただし、具体的な数値、ベンチマーク、計算コストは素材に含まれていません。そのため、現時点では単一画像3D再構成を完全に解決した手法というより、実験に支えられた構築原理として評価するのが適切です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
World in World:凍結した動画世界モデルに柔軟な視点・時間制御を追加
世界モデル
cctest.ai
世界モデル

World in World:凍結した動画世界モデルに柔軟な視点・時間制御を追加

World in World は、動画世界モデルを再学習せず、異なる視覚証拠を推論時に統合するインターフェースを提案する。視点変更、長時間の再訪、人物動作の転送を同じ仕組みで扱うことを目指す。

続きを読む
CCTest · Blog
世界モデルで自動研究エージェントの強化学習を拡張する
世界モデル
cctest.ai
世界モデル

世界モデルで自動研究エージェントの強化学習を拡張する

自動研究エージェントの強化学習では、解を生成することよりも実験の実行がボトルネックになり得ます。WMRLは世界モデルで実行結果を予測し、バイアス補正とノイズ低減を組み合わせて学習を高速化します。

続きを読む
CCTest · Blog
プログラマブル・ワールドモデルが動画生成に持続的な状態を与える
世界モデル
cctest.ai
世界モデル

プログラマブル・ワールドモデルが動画生成に持続的な状態を与える

Programmable World Model は、インタラクティブ動画モデルが長時間のやり取りで世界の状態やルールを維持しにくい問題に取り組む。世界の状態変化を実行可能なプログラムで管理し、動画モデルは主に視覚的な描画を担う。

続きを読む