記事一覧へ戻る
世界モデル

AlayaWorld:長時間の対話的生成を目指す動画ワールドモデル

読了目安 3 分

導入

従来のゲームや仮想空間の制作では、アセット制作、アニメーション、物理挙動、プログラム実装など、多くの工程が必要になる。AlayaWorld が示す方向性はこれとは異なる。ユーザーが与えたテキスト、画像、動画を起点に、探索でき、継続的に変化する仮想世界を動画ワールドモデルで生成しようとするものだ。

この技術報告の主眼は、単に短い動画を高品質に生成することではない。ユーザーが視点を動かし、プロンプトを切り替え、長く環境を探索しても、空間的・時間的な一貫性を保ちながら応答するモデルを作ることにある。

主要ポイント

  • 長時間の対話的動画生成:AlayaWorld は 24fps の動画を生成し、解像度は 540p と 720p に対応する。基盤には 15B の動画拡散 Transformer が使われ、短い latent chunk を自回帰的に生成する。
  • カメラ軌跡とプロンプト制御:生成はカメラの移動軌跡と切り替え可能なテキストプロンプトに従う。これにより、ユーザー操作が生成過程そのものに組み込まれる。
  • 有界な視覚コンテキスト:履歴を無制限に伸ばすのではなく、持続的な sink frame、圧縮された時間履歴、幾何的に整合した空間メモリ、直近フレーム条件を組み合わせている。
  • 長期ドリフトの抑制:長い動画生成では、細部や構造が徐々に崩れる問題が起こりやすい。AlayaWorld は破損した履歴や、自身の roll-out から集めた予測残差を学習に使い、誤差の蓄積に対する耐性を高めようとしている。
  • 推論の高速化:distribution-matching distillation、self-forcing++、consistency distillation を組み合わせた離散自回帰蒸留により、chunk あたりの推論を約 30 サンプリングステップから 4 ステップへ削減したとされる。

意義と影響

AlayaWorld の意義は、動画生成、インタラクション、空間メモリ、長期安定性、推論効率を一つのシステム課題として扱っている点にある。仮想世界制作、ゲームのプロトタイピング、具身 AI のシミュレーション、対話型コンテンツ制作では、環境構築のコストを下げる可能性がある。

ただし、これは従来型ゲームエンジンを直ちに置き換えるものではなく、研究基盤として見るべきだろう。実用的な仮想世界には、物理一貫性、細かな編集性、制御性、リアルタイム性がさらに必要になる。AlayaWorld がオープンソースかつフルスタックの長期プロジェクトとして位置づけられている点は、そのためにも重要だ。iWorld-Bench で長時間生成の最良性能を達成したという報告は、ワールドモデル評価の重要性も示している。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
GE-Act 2.0、ロボット向け世界行動モデルの事前学習と拡張を検証
世界モデル
cctest.ai
世界モデル

GE-Act 2.0、ロボット向け世界行動モデルの事前学習と拡張を検証

GE-Act 2.0は、事前学習済みの動画生成器に依存せず、マニピュレーションデータから世界行動モデルを学習する。訓練データを拡大することで、未知の環境や異なるロボット本体でのゼロショット操作性能が向上する可能性を示した。

続きを読む
CCTest · Blog
WorldSculpt:単一物体の3D生成先験で構成可能な世界を作る
世界モデル
cctest.ai
世界モデル

WorldSculpt:単一物体の3D生成先験で構成可能な世界を作る

WorldSculptは、単一物体向けの3D生成先験を、姿勢付きの多視点動画へ拡張する手法です。激しい遮蔽がある、数百物体規模の複雑なシーンを、共有された世界座標系内の個別メッシュとして再構成します。

続きを読む
CCTest · Blog
世界モデルを訓練後に外すと、なぜロボットは強くなるのか
世界モデル
cctest.ai
世界モデル

世界モデルを訓練後に外すと、なぜロボットは強くなるのか

光象科技と清華大学の研究チームは、世界モデルをロボットの実行時には使わず、訓練中の動作結果の評価に限定するActEffectを提案した。訓練時に多く考え、実行時は軽く動かす設計である。

続きを読む