World in World:凍結した動画世界モデルに柔軟な視点・時間制御を追加
背景
動画の世界モデルに求められるのは、次のフレームを生成することだけではない。ユーザーが記録された出来事を別の視点から探索し、長い時間にわたってカメラを動かし、以前の場所へ戻っても同じ対象や外観を保てることが重要になる。自回帰型の動画モデルは長いロールアウトを生成できる一方、柔軟な制御には課題が残る。元の出来事との時間的な同期、観測済み内容の正しい配置、新たに見える領域の補完、再訪時の外観復元を同時に満たす必要があるためだ。
論文「World in World」は、この課題に対して再学習を必要としない推論時インターフェースを提案する。基盤となる因果動画モデルは凍結したまま、さまざまな証拠を既存の自己注意へ読み込ませる。
仕組みの要点
- 異なる証拠を共通形式に変換:源動画の観測、目標視点へのシーン投影、新たに露出する領域の補完を助ける形状レンダリング、ローリングキャッシュ外から取得した生成状態を、カメラと時間の情報を持つ視覚状態に変換する。
- モデル本来の自己注意を利用:制御タスクごとに専用モジュールを追加するのではなく、凍結モデルの自己注意を通じて補助情報を参照させる。
- トークンの対応付け:対応関係ルーターは、持続的な点の識別情報と幾何情報を組み合わせる。対応が得られたクエリを一致する源動画のトークンへ導くことで、視点が変わっても対象の同一性を保ちやすくする。
- 証拠ごとの制御:証拠別注意 CFG(EWA)は、同じデノイジングの前向き計算で得られる注意の反応を使い、各補助チャネルの追加寄与を個別に調節する。
可能になること
この設計は、カメラ制御による動画の再レンダリング、長時間探索での再訪、人物動作の転送に利用される。既に観測された内容は投影情報によって目標視点に配置し、対象の新しい面が現れる場面では形状レンダリングを補助に使える。また、ローリングキャッシュを超えた過去の生成状態を取得することで、長い軌跡の中で以前の状態を参照する道筋も用意する。
論文では、多様な視点変化を伴うカメラ制御再レンダリングを対象に、知覚品質、時間的一貫性、カメラ追従精度を評価している。提供された素材には具体的な数値がないため、現時点では専用学習を全面的に置き換える手法というより、凍結モデルの制御範囲を推論時に広げる設計として捉えるのが適切だろう。
意義と残る課題
World in World の着眼点は、モデルをタスクごとに改造するのではなく、観測、幾何、時間、記憶に相当する証拠をどのように整理して渡すかにある。基盤モデルの能力を維持しながら制御信号を組み合わせられれば、探索可能な動画環境や視点変換の拡張が容易になる可能性がある。
一方、結果は源動画、幾何情報、点の対応付け、取得された生成状態、そして凍結モデルの補完能力に依存する。極端な視点変更や非常に長いロールアウトでの誤差蓄積について、素材からは十分な結論を確認できない。今後はこうした条件での安定性の検証が重要になる。
コメント
ログイン状態を確認中…
コメントを読み込み中…