記事一覧へ戻る
世界モデル

プログラマブル・ワールドモデルが動画生成に持続的な状態を与える

読了目安 3 分

導入

近年の動画ワールドモデルは、現実感のある動的な映像を生成し、ユーザーとのインタラクションにも対応し始めている。一方で、やり取りが長くなると、物体の数や位置、体力などの属性を正確に保持できないことがある。また、最初に指定したゲームルールから徐々に外れる問題も残っている。論文「Programmable World Model」は、世界がどのように変化するかと、その世界をどのように映像化するかを分離することで、この問題に対応しようとする。

仕組みの要点

  • 自然言語を実行可能なルールへ変換:エージェントが指示をプログラムに変換し、各エンティティの状態、相互作用、状態遷移の規則を記述する。
  • 軽量エンジンが状態を管理:動画生成モデルにすべてを暗黙に記憶させるのではなく、明示的なグローバル状態を維持する。カメラの外にあるエンティティや、映像だけでは確認できない属性も保持できる。
  • 3D表現で状態と映像を接続:状態情報を付加した3D指向境界ボックス(OBB)を中間表現として利用する。これを目標カメラ軌道と組み合わせ、画素に対応した時空間条件へ決定的に変換し、事前学習済み動画モデルへ渡す。
  • プレイ可能な環境を目指す:ルールと状態を明示的に扱うことで、個別エンティティの制御や、ゲーム中の状態の持続を可能にする。

評価と意義

研究チームは、カウントや状態の一貫性を評価する CombatStateBench も提案した。論文概要によると、提案手法はこのベンチマークで Count Accuracy 94%、State Accuracy 98%を達成し、既存のインタラクティブ動画ワールドモデルを大きく上回った。重要なのは映像の美しさだけではなく、検査、更新、制御が可能な状態層を追加した点にある。

この設計では、ルールエンジンが決定的なゲームメカニクスを担い、動画モデルが豊かな視覚表現を担う。両者を構造化された3D表現でつなぐことで、ゲームの試作、インタラクティブな物語、シミュレーション環境などへの応用が考えられる。画面に映っていない対象も世界の一部として存在し続けるためだ。

ただし、提供された素材には詳細な実験条件、モデル規模、実装の全容は含まれていない。したがって現時点では、長期インタラクションを完全に解決する手法というより、明示的な状態管理を取り入れるための有力なアーキテクチャとして見るのが適切だろう。今後は、指示を正確にプログラムへ変換できるか、複雑な規則を実行できるか、状態と映像の整合性を多様な環境で保てるかが焦点になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
OpenWAM:世界知識とロボット行動の事前学習を開放的に検証
世界モデル
cctest.ai
世界モデル

OpenWAM:世界知識とロボット行動の事前学習を開放的に検証

OpenWAMは、世界モデルの知識を実行可能なロボット行動へ変換する研究を、モジュール化された実験基盤として整理する。制御実験を通じて、知識の移転、世界学習と行動学習の協調、身体データによる汎化を分析した。

続きを読む
CCTest · Blog
GE-Act 2.0、ロボット向け世界行動モデルの事前学習と拡張を検証
世界モデル
cctest.ai
世界モデル

GE-Act 2.0、ロボット向け世界行動モデルの事前学習と拡張を検証

GE-Act 2.0は、事前学習済みの動画生成器に依存せず、マニピュレーションデータから世界行動モデルを学習する。訓練データを拡大することで、未知の環境や異なるロボット本体でのゼロショット操作性能が向上する可能性を示した。

続きを読む
CCTest · Blog
WorldSculpt:単一物体の3D生成先験で構成可能な世界を作る
世界モデル
cctest.ai
世界モデル

WorldSculpt:単一物体の3D生成先験で構成可能な世界を作る

WorldSculptは、単一物体向けの3D生成先験を、姿勢付きの多視点動画へ拡張する手法です。激しい遮蔽がある、数百物体規模の複雑なシーンを、共有された世界座標系内の個別メッシュとして再構成します。

続きを読む