記事一覧へ戻る
視覚・動画

VideoCoCo:Blenderコードを動画生成の「過程推論」に使う新アプローチ

読了目安 3 分

導入

テキストから動画を生成するモデルは、見た目の品質では大きく進歩しています。しかし、物体がどのように動き、衝突し、時間とともに変化するのかを自然に保つことは依然として難しい課題です。短いプロンプトには最終的に見せたい場面は書けても、運動の過程や物理的な因果関係までは十分に記述されないからです。

VideoCoCo は、この問題に対して「コードを過程レベルの思考連鎖として使う」という設計を提案します。通常の Chain-of-Thought が文章による推論や中間計画にとどまりがちなのに対し、VideoCoCo ではエージェントが Blender コードを生成します。そのコードは、シーン構成や時間的変化を明示的に定義し、実際に実行できる点が重要です。

核心ポイント

  • 二つのエンジンによる分担:一方のエンジンは Blender プログラムを実行して時空間的な草案を作り、もう一方の生成動画エンジンはその草案を条件として写実的な動画へ変換します。
  • 実行可能な中間表現:コードは単なる説明ではありません。実行、検査、修正が可能であり、動画の時間的プロセスをより具体的に制御できます。
  • 決定的な時空間草案:シミュレーションによって得られる草案は、物体の配置や動きを時間軸に沿って明示するため、動画モデルが暗黙に推測しなければならない部分を減らします。
  • VideoCoCo-3K の構築:著者らは、草案・指示・目標動画からなる三つ組データセットを整備し、シミュレーション草案を動画編集モデルに適応させています。
  • ベンチマークでの改善:論文によれば、VideoCoCo は OmniWeaving 基線を PhyGenBench で 0.475 から 0.558 へ、VBench-2.0 で 52.18 から 77.88 へ改善し、両ベンチマークの平均スコアで最良の結果を達成しました。

意義と影響

VideoCoCo の意義は、動画生成を「過程の設計」と「映像品質の実現」に分解した点にあります。すべてを一つの生成モデルに任せるのではなく、まず実行可能な世界の下書きを作り、その後に生成モデルで見た目を高める。この分担により、物理的一貫性、制御性、検査可能性を高める余地が生まれます。

もちろん、Blender のシミュレーション草案が現実世界のあらゆる複雑さを表せるわけではありません。また、エージェントが常に正しいコードを書けるか、動画編集エンジンが草案の動きをどこまで忠実に保てるかも課題です。それでも VideoCoCo は、今後の動画生成が単なるピクセル生成から、プログラム化された世界構築と生成モデルの連携へ進む可能性を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
O-VAD:工業動画の異常検知を「動画全体」から「物体ごとの状態推論」へ
視覚・動画
cctest.ai
視覚・動画

O-VAD:工業動画の異常検知を「動画全体」から「物体ごとの状態推論」へ

O-VAD は、工業プロセスの動画における異常を、物体の分割・追跡・状態軌跡の推論によって検出する学習不要のフレームワークです。前線の VLM が工業領域で苦戦する理由を、物体レベルの証拠不足として捉えています。

続きを読む
CCTest · Blog
生成動画に「再訪の記憶」を与える:学習不要の一貫性改善手法
視覚・動画
cctest.ai
視覚・動画

生成動画に「再訪の記憶」を与える:学習不要の一貫性改善手法

この論文は、3D 条件付きの長尺動画生成で起きる再訪時の見た目の不一致に注目する。過去の潜在表現を KV cache に戻し、深度とカメラ姿勢による幾何対応で注意機構を導くことで、追加学習なしに一貫性を高める。

続きを読む