記事一覧へ戻る
世界モデル

Adobe の Wonder:カメラ操作で探索できる動画ワールドモデル

読了目安 3 分

導入

Hugging Face Daily Papers に掲載された「Wonder: Video World Model Done Better」は、動画生成をよりインタラクティブな方向へ進める研究です。Wonder は、1 枚の画像または条件付き動画を入力として、ユーザーがカメラを操作しながら探索できる視覚世界を構築します。未観測の領域を見に行き、以前見た場所へ戻ることも想定されています。

これは通常の image-to-video より難しい課題です。モデルは次の数秒を自然に生成するだけでなく、カメラの移動を理解し、見えていない領域を推定し、長時間にわたって過去の場面を記憶する必要があります。

主要ポイント

  • 稠密座標場によるカメラ条件付け:Wonder は、カメラ制御を抽象的な数値入力として扱うのではなく、稠密な座標場のレンダリングを使います。これにより、動きや向きの手掛かりが画面上で空間的に整合し、モデルはカメラ運動を視覚的証拠として解釈しやすくなります。
  • 長時間生成のためのメモリ:生成が続くほど文脈は増えていきます。Wonder は疎注意に基づくメモリ機構を導入し、推論時に関連する少数のコンテキスト token だけへ選択的に注意を向けます。
  • 蒸留パイプラインの修正:self-forcing スタイルの蒸留を改善し、学生モデルが制御信号に従いやすくなると同時に、教師モデル由来の多様性と長期記憶を維持することを狙っています。
  • 動画条件生成にも対応:静止画から動画を作るだけでなく、既存の動的シーンを条件にして、新しいカメラワークでリアルタイムに撮り直すような生成も可能だとされています。

意義と影響

Wonder の重要性は、動画生成を「見るもの」から「移動して探索するもの」へ近づけている点にあります。論文概要によれば、16 FPS で分単位の多様な動画を合成し、長い rollout においても幾何、外観、動きの整合性を保つことを目指しています。これはバーチャルプロダクション、ゲーム試作、インタラクティブ映像、空間プレビューなどに示唆を与えます。

一方で、公開されている要約だけでは、複雑な物理相互作用、極端なカメラ操作、実運用時の安定性やコストまでは判断できません。それでも Wonder は、将来のワールドモデルでは制御、記憶、訓練戦略を一体で設計する必要があることを示す研究といえます。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
NVIDIA Cosmos-H-Dreams、外科ロボット向け世界モデルをリアルタイム化
世界モデル
cctest.ai
世界モデル

NVIDIA Cosmos-H-Dreams、外科ロボット向け世界モデルをリアルタイム化

NVIDIA は、外科ロボット向けのアクション条件付き生成シミュレータ Cosmos-H-Dreams を公開した。Cosmos-H-Surgical-Simulator の能力を因果的な少ステップ学生モデルへ蒸留し、FlashDreams でストリーミング推論する構成だ。

続きを読む
CCTest · Blog
UniWorld-ViewがWorldScore首位に:1枚の画像から制御可能な新視点動画へ
世界モデル
cctest.ai
世界モデル

UniWorld-ViewがWorldScore首位に:1枚の画像から制御可能な新視点動画へ

兔展智能、北京大学、鵬城実験室が開発した UniWorld-View が、李飛飛氏のチームに関連する WorldScore ランキングで首位に立った。単一画像または単眼動画から、指定したカメラ軌道に沿う新視点動画を生成できる点が注目されている。

続きを読む