記事一覧へ戻る
世界モデル

ForgeWM:1〜4ステップで動作するリアルタイム動画ワールドモデル

読了目安 3 分

導入

インタラクティブな動画ワールドモデルに求められるのは、見栄えのよいフレームを生成することだけではありません。プレイヤーの入力にすばやく反応し、過去の状態や操作と矛盾しない映像を次々に出力する必要があります。ゲームでは、キーボード入力が離散的である一方、マウス操作は連続的です。さらに動画を時間方向に圧縮すると、操作信号と潜在表現のチャンクがずれる可能性があります。ForgeWMは、このずれを意識した少ステップ因果学習の枠組みを提案します。

4段階の学習設計

ForgeWMは、双方向の動作条件付き動画生成器を出発点にします。いきなり1ステップへ圧縮するのではなく、次の段階を順番に適用します。

  • ドメイン適応:インタラクティブなゲーム映像と操作信号にモデルを合わせます。
  • 教師強制因果学習:実際の履歴状態を使いながら、自回帰的な生成動作を学習させます。
  • 因果一貫性蒸留:時間圧縮された状態でも、教師と整合する予測関係を保たせます。
  • オンポリシー分布マッチング:双方向教師を利用し、学習時の状態とロールアウト時に現れる状態の差を抑えます。

この結果、推論時のデノイズ予算が1、2、4ステップの学生モデルが得られます。用途ごとに予算を固定することで、低遅延を優先する構成と、画質を重視する構成を明確に選択できます。

プレイ中とリプレイ時を分ける

ForgeWMのもう一つの特徴は、運用を2つの経路に分けることです。プレイ中は1ステップモデルが素早く草稿映像を作り、操作への応答性を優先します。その結果を保存しておけば、後から再ノイズ化し、追加のデノイズで映像を改善できます。純粋なノイズから作り直すのではなく、プレイヤーが実際に経験した軌跡を出発点にする点が重要です。

論文によれば、リプレイ時の精細化は4ステップの参照品質に達し、ノイズから再生成する方法と比べて、経験軌跡との距離をおよそ3分の1に抑えました。高速な推論結果を単なる近似ではなく、後処理可能な中間表現として扱う設計です。

評価と意義

対応するMinecraft軌跡での評価では、ForgeWMは比較対象の中で、画像品質、参照動作プロファイルとの一致、操作方向の正確さ、マウス制御精度において良好な結果を示し、参照映像に対するLPIPSも最小でした。同じ4段階のレシピは、ゲームパッドで操作するFPSにも移植されています。

この研究の意義は、少ステップ動画蒸留をインタラクティブな世界モデルの閉ループに接続した点にあります。生成速度、操作との整合性、長期的な自回帰安定性を別々の工夫ではなく、一つの学習工程で扱っています。長時間の世界シミュレーションという課題がすべて解決されたわけではありませんが、キーボード、マウス、ゲームパッドを含むオープンで再現可能な実装は、プレイ可能なリアルタイム世界モデルへの具体的な足場になります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
WorldRover、探索可能な世界モデル向けの豊富な合成動画を生成
世界モデル
cctest.ai
世界モデル

WorldRover、探索可能な世界モデル向けの豊富な合成動画を生成

WorldRover は、Unreal Engine を基盤に、長時間の探索経路と幾何・動き・対応関係の注釈を同時に生成するデータエンジンです。環境を維持・再訪できる世界モデルの学習を支えることを狙います。

続きを読む
CCTest · Blog
StateFlow:生成型プリビズを編集可能な3D世界状態へ
世界モデル
cctest.ai
世界モデル

StateFlow:生成型プリビズを編集可能な3D世界状態へ

StateFlow は、映画、ゲーム、建築、都市設計向けの生成型プリビジュアライゼーションを、永続的な3D世界状態として扱う枠組みです。動画を一度に生成するのではなく、構築・進化・アクセス可能な編集用ワールドを中心に据えます。

続きを読む