記事一覧へ戻る
世界モデル

ForgeWM:1〜4ステップで動作するリアルタイム動画ワールドモデル

読了目安 3 分

導入

インタラクティブな動画ワールドモデルに求められるのは、見栄えのよいフレームを生成することだけではありません。プレイヤーの入力にすばやく反応し、過去の状態や操作と矛盾しない映像を次々に出力する必要があります。ゲームでは、キーボード入力が離散的である一方、マウス操作は連続的です。さらに動画を時間方向に圧縮すると、操作信号と潜在表現のチャンクがずれる可能性があります。ForgeWMは、このずれを意識した少ステップ因果学習の枠組みを提案します。

4段階の学習設計

ForgeWMは、双方向の動作条件付き動画生成器を出発点にします。いきなり1ステップへ圧縮するのではなく、次の段階を順番に適用します。

  • ドメイン適応:インタラクティブなゲーム映像と操作信号にモデルを合わせます。
  • 教師強制因果学習:実際の履歴状態を使いながら、自回帰的な生成動作を学習させます。
  • 因果一貫性蒸留:時間圧縮された状態でも、教師と整合する予測関係を保たせます。
  • オンポリシー分布マッチング:双方向教師を利用し、学習時の状態とロールアウト時に現れる状態の差を抑えます。

この結果、推論時のデノイズ予算が1、2、4ステップの学生モデルが得られます。用途ごとに予算を固定することで、低遅延を優先する構成と、画質を重視する構成を明確に選択できます。

プレイ中とリプレイ時を分ける

ForgeWMのもう一つの特徴は、運用を2つの経路に分けることです。プレイ中は1ステップモデルが素早く草稿映像を作り、操作への応答性を優先します。その結果を保存しておけば、後から再ノイズ化し、追加のデノイズで映像を改善できます。純粋なノイズから作り直すのではなく、プレイヤーが実際に経験した軌跡を出発点にする点が重要です。

論文によれば、リプレイ時の精細化は4ステップの参照品質に達し、ノイズから再生成する方法と比べて、経験軌跡との距離をおよそ3分の1に抑えました。高速な推論結果を単なる近似ではなく、後処理可能な中間表現として扱う設計です。

評価と意義

対応するMinecraft軌跡での評価では、ForgeWMは比較対象の中で、画像品質、参照動作プロファイルとの一致、操作方向の正確さ、マウス制御精度において良好な結果を示し、参照映像に対するLPIPSも最小でした。同じ4段階のレシピは、ゲームパッドで操作するFPSにも移植されています。

この研究の意義は、少ステップ動画蒸留をインタラクティブな世界モデルの閉ループに接続した点にあります。生成速度、操作との整合性、長期的な自回帰安定性を別々の工夫ではなく、一つの学習工程で扱っています。長時間の世界シミュレーションという課題がすべて解決されたわけではありませんが、キーボード、マウス、ゲームパッドを含むオープンで再現可能な実装は、プレイ可能なリアルタイム世界モデルへの具体的な足場になります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
RealtimeWAM:世界行動モデルを1ステップ・非同期推論へ
世界モデル
cctest.ai
世界モデル

RealtimeWAM:世界行動モデルを1ステップ・非同期推論へ

RealtimeWAMは、世界行動モデルにおける多段階の行動デノイズと、動画エキスパートと行動エキスパート間の待ち時間を同時に削減する。論文では、H100上で最大25倍のエンドツーエンド高速化と、1%未満の精度低下が報告されている。

続きを読む
CCTest · Blog
JEPA-TTT、世界モデルをテスト時に継続適応させる
世界モデル
cctest.ai
世界モデル

JEPA-TTT、世界モデルをテスト時に継続適応させる

JEPA-TTTは、学習時と異なる環境ダイナミクスに直面した際、事前学習済みJEPA世界モデルを運用中に適応させる手法です。視覚表現と報酬ヘッドを固定し、潜在ダイナミクス予測器だけを自己教師ありで更新します。

続きを読む
CCTest · Blog
ProWAM、段階的な視覚サブゴールでロボットの長期制御を支援
世界モデル
cctest.ai
世界モデル

ProWAM、段階的な視覚サブゴールでロボットの長期制御を支援

ProWAMは、世界行動モデルに順序付きの疎な視覚サブゴールを導入し、未来の動画全体を生成せずにロボットへ中間目標を与える。複数のシミュレーション評価で、分布外環境に対する頑健性の向上が報告された。

続きを読む