VideoCoCo:Blenderコードを動画生成の「過程推論」に使う新アプローチ
導入
テキストから動画を生成するモデルは、見た目の品質では大きく進歩しています。しかし、物体がどのように動き、衝突し、時間とともに変化するのかを自然に保つことは依然として難しい課題です。短いプロンプトには最終的に見せたい場面は書けても、運動の過程や物理的な因果関係までは十分に記述されないからです。
VideoCoCo は、この問題に対して「コードを過程レベルの思考連鎖として使う」という設計を提案します。通常の Chain-of-Thought が文章による推論や中間計画にとどまりがちなのに対し、VideoCoCo ではエージェントが Blender コードを生成します。そのコードは、シーン構成や時間的変化を明示的に定義し、実際に実行できる点が重要です。
核心ポイント
- 二つのエンジンによる分担:一方のエンジンは Blender プログラムを実行して時空間的な草案を作り、もう一方の生成動画エンジンはその草案を条件として写実的な動画へ変換します。
- 実行可能な中間表現:コードは単なる説明ではありません。実行、検査、修正が可能であり、動画の時間的プロセスをより具体的に制御できます。
- 決定的な時空間草案:シミュレーションによって得られる草案は、物体の配置や動きを時間軸に沿って明示するため、動画モデルが暗黙に推測しなければならない部分を減らします。
- VideoCoCo-3K の構築:著者らは、草案・指示・目標動画からなる三つ組データセットを整備し、シミュレーション草案を動画編集モデルに適応させています。
- ベンチマークでの改善:論文によれば、VideoCoCo は OmniWeaving 基線を PhyGenBench で 0.475 から 0.558 へ、VBench-2.0 で 52.18 から 77.88 へ改善し、両ベンチマークの平均スコアで最良の結果を達成しました。
意義と影響
VideoCoCo の意義は、動画生成を「過程の設計」と「映像品質の実現」に分解した点にあります。すべてを一つの生成モデルに任せるのではなく、まず実行可能な世界の下書きを作り、その後に生成モデルで見た目を高める。この分担により、物理的一貫性、制御性、検査可能性を高める余地が生まれます。
もちろん、Blender のシミュレーション草案が現実世界のあらゆる複雑さを表せるわけではありません。また、エージェントが常に正しいコードを書けるか、動画編集エンジンが草案の動きをどこまで忠実に保てるかも課題です。それでも VideoCoCo は、今後の動画生成が単なるピクセル生成から、プログラム化された世界構築と生成モデルの連携へ進む可能性を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…