記事一覧へ戻る
世界モデル

ShadowDancer:動画世界モデルに「任意の行動」を教える新しい動的表現

読了目安 3 分

導入

動画世界モデルは、単にもっともらしい映像を生成する段階から、ユーザーの操作に応じて世界を進める段階へ向かっている。しかし難しいのは、映像を動かすこと自体ではない。同じジャンプ、回転、押す動作、カメラ移動を、別のキャラクター、背景、視点、環境に移しても同じ行動として扱えるかが問題になる。ShadowDancer は、この「行動をどう表現するか」という課題に焦点を当てている。

主要ポイント

  • 既存の行動インターフェースには限界がある。 粗い行動記述では、行動がどのように展開するかをモデルの補完に任せることになる。一方で、構造化された信号は精密だが、特定のタスクやデータ形式に依存しやすく、幅広い行動に使うには取得が難しい。
  • デモ動画は行動を逐フレームで示せる。 動画は動きの進み方を自然に含んでいるため、行動の教材として適している。ただし通常の動画では、動きと人物、背景、質感、照明などの外観が強く結び付いている。
  • Shadow pairs が外観と動きを切り分ける。 論文では、同じダイナミクスを再生しながら、外観だけを独立に再サンプリングした動画ペアを構成する。2本の動画で共通して残るものは行動に近く、変化するものは捨てるべき外観情報だと考えられる。
  • Cross-shadow prediction が行動表現を引き出す。 一方の「影」からもう一方の「影」を予測することで、モデルはペア間で保存される動的情報を使い、再サンプリングされた外観情報を無視するよう促される。この統一表現は block-causal world model を駆動するために使われる。
  • デモクリップを行動資産として再利用できる。 著者らは、行動ラベル、モーション推定器、追加のファインチューニングなしで、任意のデモ動画を新しい環境で再生できる点を強調している。

意義と影響

ShadowDancer の本質は、「何が起きているか」を「どのように見えるか」から分離しようとする点にある。個別の制御信号をゲーム、人間動作、カメラ、ロボットごとに設計する代わりに、示すことができる行動全般に使える共通インターフェースを目指している。

この方向が十分に堅牢になれば、インタラクティブな世界モデルは手作りの行動スキーマだけでなく、動画デモそのものから制御可能になる。ゲーム AI、身体性 AI、ロボットシミュレーション、制御可能な動画生成にとって、行動ライブラリをより柔軟に作る道が開ける。ただし提供された素材では詳細な実験数値や失敗条件は示されていないため、実用上の限界は論文本文で確認する必要がある。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Pelican-Sim 1.0、ロボット向け汎用ワールドモデルを構築
世界モデル
cctest.ai
世界モデル

Pelican-Sim 1.0、ロボット向け汎用ワールドモデルを構築

Pelican-Sim 1.0は、視覚コンテキストとロボットの行動から将来の観測を予測する、具現化知能向けの汎用シミュレーターです。統一行動空間、行動動画の注入、疎なMoE、少ステップ生成によって、異なるロボットへの制御性と生成効率を高めます。

続きを読む
CCTest · Blog
World in World:凍結した動画世界モデルに柔軟な視点・時間制御を追加
世界モデル
cctest.ai
世界モデル

World in World:凍結した動画世界モデルに柔軟な視点・時間制御を追加

World in World は、動画世界モデルを再学習せず、異なる視覚証拠を推論時に統合するインターフェースを提案する。視点変更、長時間の再訪、人物動作の転送を同じ仕組みで扱うことを目指す。

続きを読む
CCTest · Blog
1枚の画像から実行可能な世界へ:RCWMが再帰的に3Dシーンを構築
世界モデル
cctest.ai
世界モデル

1枚の画像から実行可能な世界へ:RCWMが再帰的に3Dシーンを構築

Recursive Code World Models(RCWM)は、1枚の参照画像から複雑な3D世界を実行可能なコードとして再構成する手法です。全体・局所・全体の再帰ループにより、細部を調整しながらシーン全体の空間関係を維持します。

続きを読む