WorldGuide、動画世界モデルを目標指向のタスク実行器へ
はじめに
動画生成モデルは、見た目に自然な視覚軌跡を作れるようになっている。しかし、自然な映像を生成することと、手順型タスクを最後まで正しく完了することは同じではない。物体を整理したり、複数の操作を順番に実行したりする場合、モデルは現在の状態を把握し、次の行動を選び、その行動を実現し、目標達成を確認しなければならない。WorldGuideは、この問題を動画生成ではなく閉ループのタスク実行として定式化する。
計画と実行を繰り返す仕組み
WorldGuideへの入力は、初期画像とタスク目標である。ContextPlannerは、生成された現在の視覚状態から次の原子アクションを予測する。タスクが完了したと判断した場合は、終了を示すトークンを出力する。続いてExecutorが、そのアクションを動画クリップとして生成する。生成結果が次の視覚状態となり、システムは継続、修正、終了のいずれかを判断する。
この仕組みは、オープンループ生成の弱点を補う。あらかじめ全軌跡を決めてしまう方式では、途中で予想外の状態になっても、その後の行動を調整しにくい。WorldGuideでは各クリップの結果が次の計画に影響するため、行動の選択と実行結果を分離しない。プランナーとエグゼキューターは同じステップ単位の手順データで訓練され、行動を決めることと、その行動を動画として実現することの差を縮める設計になっている。
長いタスクでは履歴の管理も問題になる。過去の全フレームを保持すれば、コンテキストコストは増え続ける。WorldGuideは階層型の視覚メモリを使い、必要な状態情報を残しながら履歴トークンの増加を抑える。また、共同訓練に必要なデータ不足を補うため、約5.9万本のステップ注釈付き動画からなるWorldGuide Benchを構築した。このベンチマークは245タスク、27の手順カテゴリを含む。
結果と読み解き
WorldGuide BenchでのTask Successは33.33%で、参照アクション計画を受け取るMiniMax-H3の29.90%を上回った。Video-CraftBenchでは47.69%に達し、目標だけを条件にした場合の32.73%を上回っている。逐次計画、アクションの実現、視覚フィードバックを組み合わせることが、手順型動画タスクに有効である可能性を示す結果だ。
ただし、これは問題の解決を意味しない。局所的に正しい動作を含む動画でも、全体の状態が崩れている場合がある。また、もっともらしい映像だけでは、最終目標が達成されたことを保証できない。今後は状態検証、失敗からの回復、未知のタスクへの汎化が重要になる。
意義
WorldGuideは、動画生成、視覚計画、具身知能をつなぐ枠組みを提示する。世界モデルは未来の画面を予測するだけでなく、自分が生成した状態を確認し、必要なら行動を修正する必要がある。ロボットシミュレーション、インタラクティブ環境、手順型コンテンツ生成への応用が期待される。
コメント
ログイン状態を確認中…
コメントを読み込み中…