EditWorld、動画世界モデルを「探索」から精密編集へ
導入
動画世界モデルは、ユーザーが移動や操作を行える環境を生成する技術として発展してきました。一方で、生成された世界の内容をユーザーの意図に合わせて正確に変更する能力は、探索能力ほど重視されてきませんでした。オブジェクトの変更、見た目の差し替え、生成途中での修正といった作業には、別の制御機構が必要です。
EditWorldは、この課題に取り組む動画世界モデルです。世界を一度生成して終わるのではなく、生成が続く間も編集可能な状態として扱い、探索中心の世界モデルを段階的な変更へ拡張しようとしています。
主なポイント
- 生成途中の編集に対応。 EditWorldでは、自己回帰生成の途中で編集指示や参照画像を入力できます。現在の出力を確認しながら次の指示を出す、反復的な制作フローを想定した設計です。
- 変化する条件をゲート付き因果注意で処理。 指示や参照画像は、動画のすべての時点で同じ重要度を持つとは限りません。Gated Causal Attentionは、時間によって変わる編集条件を扱いながら、動画の因果的な生成順序を維持するために導入されています。
- 疎なコンテキストで長期推論を支援。 長い生成では、過去の状態をすべて保持すると計算負荷が増えます。Sparse Contextは履歴を一定範囲に抑えつつ、世界の状態や過去の編集結果に関係する情報を残す仕組みです。
- 編集向けの学習とデータを整備。 自己回帰学習と双方向学習を組み合わせ、アンニールした自己リサンプリングも用います。また、世界編集を監督するためのデータ合成・アノテーションパイプラインを構築しています。
- 編集能力を個別に評価。 WBench-Editingは、ストリーミング形式の世界編集を体系的に測るためのベンチマークです。論文概要によれば、EditWorldは総合スコア73.8、編集スコア80.0を達成し、編集関連指標で既存手法を上回りました。
意義と残る課題
EditWorldが示す重要な方向性は、世界モデルを「見るだけの環境」から「生成しながら作り替えられる環境」へ変えることです。インタラクティブな物語、ゲームの試作、仮想環境、映像制作では、最初から完璧な結果を得るより、出力を確認して修正を重ねる方が自然です。生成中の編集は、このワークフローと世界モデルを接続する基盤になり得ます。
ただし、提供された情報だけでは、複雑な場面での長期的な一貫性、指示同士の衝突、参照画像の多様性、推論コストなどを十分に判断できません。ベンチマークでの編集性能を、実際の長時間利用や製品環境でどこまで維持できるかが今後の焦点です。
コメント
ログイン状態を確認中…
コメントを読み込み中…