記事一覧へ戻る
世界モデル

EchoWM:連続ナビゲーションに対応する全モーダル世界モデル

読了目安 3 分

はじめに

現在の動画生成モデルは、文章や画像から短い映像を作ることには優れています。しかし、ユーザーがシーンの中に入り、連続的に移動できる世界を作るには別の難しさがあります。視点を動かしたとき、映像は単に新しいフレームを出すだけでなく、空間の連続性を保たなければなりません。同時に、環境音や音声も場面の変化と整合する必要があります。EchoWMはこの課題に対し、映像と音をまとめて生成する「入り込める」全モーダル世界モデルを提案します。

主なポイント

  • 単発生成から継続的な操作へ。 EchoWMは一つのプロンプトだけでなく、継続するナビゲーション入力に応答します。入力は位置と姿勢の変化を含む相対6自由度軌跡として扱われます。
  • 異なる操作方法を共通化。 離散的なコマンドと連続的なカメラポーズを、同じメートル尺度の軌跡空間へ写像します。さらにデータセット単位の校正によって、異なるデータの運動量をそろえます。
  • 一人称と三人称に対応。 一人称シーンでは、カメラ意図が観察者の動きを直接指定します。三人称シーンでは、視点専用のコントローラーを使うのではなく、データからカメラとキャラクターの関係を学習します。
  • 映像と音を同時に発展。 環境音、音楽、音声を映像とともに生成し、長い生成過程でも時間的な同期を保つことを目指します。
  • 長時間生成を段階的に学習。 補完的なデータエンジンを構築し、プログレッシブ学習の後に自己回帰型の追加学習を行います。

意義と限界

EchoWMが示す方向性は、世界モデルを動画の予測器から、操作可能な生成環境へ広げるものです。連続軌跡は、仮想空間を歩き回る実際の利用形態に近く、共通の6自由度表現は異なる視点やデータ源を接続するインターフェースになります。全モーダル化によって、品質の基準も画素だけではなくなります。カメラの動き、環境音、音楽、発話が同じ時間軸で整合している必要があるためです。

提供された要約によれば、EchoWMは公開世界モデルベンチマークで強い軌跡追従性能と映像品質を示し、さまざまな対象の一人称・三人称インタラクションに対応します。また、長時間生成で環境音と音声の同期も維持するとされています。一方、今回の資料には具体的なスコア、モデル規模、推論コスト、重みの公開状況は含まれていません。そのため、現時点では完全な再現手順ではなく、手法とシステム設計の概要として読むのが適切です。

この研究の流れが進めば、生成ゲーム、バーチャル撮影、没入型物語、身体を持つエージェントのシミュレーションは、単発のコンテンツ生成から継続的に探索できる世界の生成へ移行する可能性があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ForgeWM:1〜4ステップで動作するリアルタイム動画ワールドモデル
世界モデル
cctest.ai
世界モデル

ForgeWM:1〜4ステップで動作するリアルタイム動画ワールドモデル

ForgeWMは、双方向の動作条件付き動画生成器を、ゲーム操作に対応した少ステップの因果ワールドモデルへ変換する段階的な学習手法です。低遅延生成と、入力操作と映像の整合性を両立することを狙います。

続きを読む
CCTest · Blog
WorldRover、探索可能な世界モデル向けの豊富な合成動画を生成
世界モデル
cctest.ai
世界モデル

WorldRover、探索可能な世界モデル向けの豊富な合成動画を生成

WorldRover は、Unreal Engine を基盤に、長時間の探索経路と幾何・動き・対応関係の注釈を同時に生成するデータエンジンです。環境を維持・再訪できる世界モデルの学習を支えることを狙います。

続きを読む
CCTest · Blog
StateFlow:生成型プリビズを編集可能な3D世界状態へ
世界モデル
cctest.ai
世界モデル

StateFlow:生成型プリビズを編集可能な3D世界状態へ

StateFlow は、映画、ゲーム、建築、都市設計向けの生成型プリビジュアライゼーションを、永続的な3D世界状態として扱う枠組みです。動画を一度に生成するのではなく、構築・進化・アクセス可能な編集用ワールドを中心に据えます。

続きを読む