World Embedding Benchmark、動画モデルの物理理解を検証
導入
動画生成モデルや世界モデルの評価では、映像が自然に見えるかどうかが長く重視されてきた。しかし、見た目がもっともらしい動画でも、物体の衝突、運動、流体の挙動、光の変化などが物理法則に反している可能性がある。そこで重要になるのが、動画表現が物理情報を本当に符号化しているのか、そしてその情報をモデルが利用できるのかという問いである。World Embedding Benchmarkは、この問いを定量的に調べるための評価基盤だ。
制御されたシミュレーションで物理表現を測る
ベンチマークには、80の物理ファミリーからなる8,000件の制御されたシミュレーション事例が含まれる。対象は流体力学、固体力学、力学、光学・電磁気学にまたがる。各事例では、レンダリングされた動画と、シミュレーションから得られた物理アノテーションが対応付けられている。
実データだけで物理理解を調べると、視覚的な条件やパラメータを完全に揃えるのが難しい。シミュレーションを使えば、物理パラメータや見た目の条件を体系的に変えられるため、モデルが単なる外観ではなく、どの情報を捉えているのかを分析しやすい。
評価タスクは次の三つである。
- テキスト・動画検索:物理過程を説明する文章と動画を対応付ける。
- 物理属性回帰:固定した動画埋め込みから、シミュレーション由来の定量属性を推定する。
- 動画・説明ペア分類:複数の説明から、動画と一致するものを選ぶ。
検索とペア分類は、動画と文章の間の物理的な対応を主に測る。一方、回帰は、埋め込みに数値的な物理情報が残っているかを調べる。この区別が本研究の重要な点である。
物理情報の保持とクロスモーダルな整合は異なる
評価された事前学習済みの全モーダル埋め込みモデルは、物理に関する検索で弱い性能を示し、同一ファミリー内のペア分類もほぼチャンスレベルに近かった。一般的な視覚表現を持っていても、動画中の変化を正確な物理説明と結び付けられるとは限らない。
しかし、軽量なプローブを使うと、固定された動画埋め込みから有用な物理情報を復元できた。つまり、物理的な信号は表現の内部に残っていても、言語と検索可能な形で整理されていない可能性がある。情報が「含まれている」ことと、モデルが「使える」ことは同じではない。
物理に特化した動画・テキスト対で継続的な対照学習を行うと、検索とペア分類は改善した。一方、物理属性回帰は悪化した。この結果は、クロスモーダルな整合を高めることと、細かな定量情報を保持することの間にトレードオフがあることを示す。
生成モデルへの応用
研究チームはさらに、埋め込みを使ってMiniMax-H3のために物理的に関連する参考動画を検索し、検索拡張型の動画生成を試した。報告された実験では、参考動画を与えることで生成動画の物理的な忠実度が向上し、検索モデルが強いほど改善も大きくなった。資料中では、物理適応を行ったLCO-Embedding-Omniが、この設定で最も強い性能を示している。
この研究が示すのは、世界モデルを単一の指標だけで評価するべきではないということだ。見た目の品質、文章との整合、物理属性の復元は、それぞれ異なる能力を測定する。今後、シミュレーションエンジン、データセット、評価コード、学習済みチェックポイントが公開されれば、認識・検索・生成をつなぐ物理表現の研究を再現可能な形で進められる。
コメント
ログイン状態を確認中…
コメントを読み込み中…