ABot-World-0:単一デスクトップGPUで動くリアルタイム世界モデル
導入
世界モデルに求められる能力は、単に本物らしい動画を作ることだけではありません。ユーザーやエージェントの行動入力に反応し、長時間にわたって場面の整合性を保ち、次の操作に間に合う速度で映像を返す必要があります。ABot-World-0 は、この「操作できる動画生成」を中心に設計された行動条件付き世界モデルです。
論文が狙うのは、長時間の閉ループインタラクションです。キーボード入力のような生の行動を受け取り、それに応じて次のフレームを生成することで、ユーザーが世界を歩き回ったり、三人称キャラクターを操作したりできる環境を作ろうとしています。
主要ポイント
- テキストから動画ではなく、行動から世界を進める:ABot-World-0 は、原始的なキーボード操作を統一的な制御インターフェースとして扱います。これにより、シーンのローミングと三人称キャラクターの操作を同じ枠組みで扱えるようにしています。
- 多様なデータ基盤:データは AAA ゲーム、シミュレーションエンジン、インターネット動画にまたがります。WorldExplorer は学習フィードバックに基づいてエージェント主導のデータ収集を行い、処理パイプラインでは 14 種類の決定的品質チェック、VLM による評価、行動とテキストの同期アノテーションを行います。
- 教師モデルから学生モデルへの段階的蒸留:研究では、双方向の行動条件付き教師モデルを用意し、teacher forcing と ODE distillation を通じて、オンライン生成に適した因果的な学生モデルへ蒸留します。
- LongForcing による長時間安定化:自己回帰的なロールアウトでは、生成結果が次の入力分布に影響し、時間が長くなるほど誤差が蓄積しやすくなります。ABot-World-0 は LongForcing によって、学生モデルの長い自己ロールアウトをより長い視野を持つ教師に合わせ、分布ずれとドリフトの軽減を狙います。
- キャラクターの一貫性:三人称視点では、キャラクターの外見が時間とともに変化してしまう問題があります。reference-character memory は、外見とアイデンティティの持続的な手がかりを与え、長いロールアウトでの一貫性を支えます。
- 推論スタックの最適化:軽量 VAE デコーダ、効率的な注意機構、メモリを意識したスケジューリング、低ビット DiT 推論を組み合わせます。論文によれば、最適化された低ビット構成では、単一の NVIDIA RTX 5090 で 720P 動画を最大 16 FPS でストリーミングし、行動から最初のフレームまでの遅延は約 1.2 秒、ピーク VRAM は約 19GiB です。
意義と影響
ABot-World-0 の重要性は、世界モデルを短いデモ動画から、操作可能なシステムへ近づけている点にあります。ゲームの試作、具身 AI の訓練環境、仮想キャラクター、シミュレーション生成では、画質だけでなく、操作性、遅延、長時間の整合性、計算資源の制約が重要になります。
もちろん、提示された結果は WorldRoamBench と拡張インタラクティブロールアウト上の評価であり、既存のゲームエンジンや汎用シミュレータをすぐ置き換えるものではありません。それでも、データ収集、行動条件付きモデリング、長時間蒸留、推論最適化を一体で設計する方向性は、今後のインタラクティブ世界モデルにとって重要な示唆を与えます。
コメント
ログイン状態を確認中…
コメントを読み込み中…