ForgeWM:1〜4ステップで動作するリアルタイム動画ワールドモデル
導入
インタラクティブな動画ワールドモデルに求められるのは、見栄えのよいフレームを生成することだけではありません。プレイヤーの入力にすばやく反応し、過去の状態や操作と矛盾しない映像を次々に出力する必要があります。ゲームでは、キーボード入力が離散的である一方、マウス操作は連続的です。さらに動画を時間方向に圧縮すると、操作信号と潜在表現のチャンクがずれる可能性があります。ForgeWMは、このずれを意識した少ステップ因果学習の枠組みを提案します。
4段階の学習設計
ForgeWMは、双方向の動作条件付き動画生成器を出発点にします。いきなり1ステップへ圧縮するのではなく、次の段階を順番に適用します。
- ドメイン適応:インタラクティブなゲーム映像と操作信号にモデルを合わせます。
- 教師強制因果学習:実際の履歴状態を使いながら、自回帰的な生成動作を学習させます。
- 因果一貫性蒸留:時間圧縮された状態でも、教師と整合する予測関係を保たせます。
- オンポリシー分布マッチング:双方向教師を利用し、学習時の状態とロールアウト時に現れる状態の差を抑えます。
この結果、推論時のデノイズ予算が1、2、4ステップの学生モデルが得られます。用途ごとに予算を固定することで、低遅延を優先する構成と、画質を重視する構成を明確に選択できます。
プレイ中とリプレイ時を分ける
ForgeWMのもう一つの特徴は、運用を2つの経路に分けることです。プレイ中は1ステップモデルが素早く草稿映像を作り、操作への応答性を優先します。その結果を保存しておけば、後から再ノイズ化し、追加のデノイズで映像を改善できます。純粋なノイズから作り直すのではなく、プレイヤーが実際に経験した軌跡を出発点にする点が重要です。
論文によれば、リプレイ時の精細化は4ステップの参照品質に達し、ノイズから再生成する方法と比べて、経験軌跡との距離をおよそ3分の1に抑えました。高速な推論結果を単なる近似ではなく、後処理可能な中間表現として扱う設計です。
評価と意義
対応するMinecraft軌跡での評価では、ForgeWMは比較対象の中で、画像品質、参照動作プロファイルとの一致、操作方向の正確さ、マウス制御精度において良好な結果を示し、参照映像に対するLPIPSも最小でした。同じ4段階のレシピは、ゲームパッドで操作するFPSにも移植されています。
この研究の意義は、少ステップ動画蒸留をインタラクティブな世界モデルの閉ループに接続した点にあります。生成速度、操作との整合性、長期的な自回帰安定性を別々の工夫ではなく、一つの学習工程で扱っています。長時間の世界シミュレーションという課題がすべて解決されたわけではありませんが、キーボード、マウス、ゲームパッドを含むオープンで再現可能な実装は、プレイ可能なリアルタイム世界モデルへの具体的な足場になります。
コメント
ログイン状態を確認中…
コメントを読み込み中…