Physis-Lang:進化する物理言語で動画世界モデルを改善
導入
動画世界モデルに求められるのは、見た目に自然な映像を作ることだけではありません。物体が接触した後にどう動くのか、力が加わった結果がいつ現れるのかなど、現実世界の変化を物理法則に沿って予測する必要があります。しかし現在の生成モデルは、映像としてはもっともらしくても、衝突や落下、因果関係、時間順序に不自然さを残すことがあります。Physis-Langは、この問題に対して、追加の潜在表現や数値信号だけに頼らず、物理を説明する言語そのものを改善する方向を示します。
主な仕組み
- プロセスを詳細な言語で表す。 Physis-Langは、単に「物体が動く」と記述するのではなく、関係するエンティティ、原因、相互作用、支配原理、時間的な変化、結果を記述します。キャプションを場面のラベルではなく、物理過程の説明として扱う点が特徴です。
- 原子断言でキャプションを評価する。 PhysCapBenchは物理過程を細かな断言に分解し、再現率と適合率でキャプションを評価します。重要な情報の取りこぼしだけでなく、映像にない物理的事実を付け加える問題も確認できます。
- エージェントによって指示を反復改善する。 システムは断言単位の誤りを分析し、物理キャプションを生成する指示を更新します。物理言語は固定されたテンプレートではなく、評価結果に応じて進化する表現になります。
- 不足するデータを言語で探す。 モデルの弱点をテキスト化し、言語誘導検索によって、欠けている物理過程を含み、視覚的にも多様な動画を探します。これにより、データキュレーションと生成モデルの失敗が一つのループで結び付けられます。
結果と意義
研究では、WanとCosmosをバックボーンとして、広く利用されている4つの物理動画ベンチマークで評価を行いました。提供された素材によれば、Physis-Langは各設定で物理的妥当性を一貫して改善しました。特に、オープンソースのCosmos3-Nanoを出発点としたモデルが、論文内の比較でプロプライエタリなVeo 3.1を上回ったと報告されています。
この研究の重要性は、言語を単なる入力プロンプトではなく、データ、学習、生成をつなぐ共通表現として位置付けた点にあります。言語によって動画の物理過程を説明し、モデルの不足を発見し、その不足を埋めるデータを検索できます。より大きなモデルや不透明な潜在信号だけに依存しない、解釈しやすい改善経路になり得ます。
一方、結論は報告されたベンチマークとモデル構成の範囲で捉える必要があります。複雑な三次元相互作用、長時間のダイナミクス、開放世界の場面でも同じ効果が得られるかは、今後の検証課題です。それでもPhysis-Langは、世界モデルには動画の量だけでなく、因果関係と時間変化を正確に語る言語も必要だという論点を提示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…