世界モデルに「物体の永続性」を学習させるWROP
物体の永続性を動画モデルで測る
ボールが遮蔽物の後ろに消えても、人間は通常、それが消滅したのではなく、遮蔽物の向こう側に存在し続けていると考える。この「物体の永続性」は、場面の連続性を理解し、物理的な動きを予測し、行動を計画するための基礎となる。
論文「Training Object Permanence in World Models」は、現在の動画生成モデルがこの能力をすでに持つのか、また不足しているなら専用データで訓練できるのかを調べた研究だ。
認知課題を大規模データへ変換
研究チームはWROP(World Reasoning with Object Permanence)を提案した。これは認知科学に着想を得て設計した150の課題からなるデータ基盤で、課題は6つの認知カテゴリーに分けられている。対象となるのは、遮蔽された物体の存在、動きの連続性、物体の固体性などに関わる推論だ。
各課題にはBlenderベースのデータ生成器が用意されている。速度、照明、カメラ角度などの表面的な条件をランダム化しつつ、課題が問う認知構造は維持する。これにより、モデルが決まった画面や動きのパターンを暗記するだけでは対応しにくくなり、遮蔽や位置変化、物体同一性といった関係に注目することが期待される。
各課題から1万件以上のサンプルを生成でき、全体で150万サンプルの訓練コーパスが構築された。さらに、比較評価用として300問の試験も公開されている。
PWM-WROPの評価結果
研究では、参照画像から動画を生成するモデル3種、動画編集モデル7種、動画継続モデル4種の計14モデルを評価した。その中には、160億パラメータの世界モデルPWM-WROPも含まれる。
盲検のペア比較をEloスコアに集約した結果、PWM-WROPは動画継続モデルの中で1位、全体では3位となった。上位2モデルは参照画像から動画を生成するモデルで、両者の差は統計的には同点だった。
この結果は、認知科学の概念を中心にデータを設計すれば、対応する世界モデル課題の性能を改善できる可能性を示す。ただし、WROPでの成功をそのまま一般的な物理理解や人間レベルの推論と見なすことはできない。評価対象は、設計された合成タスクとその試験に限定されているためだ。
研究の意義
WROPの重要な点は、課題設計、手続き的なデータ生成、訓練コーパス、評価試験を一つの再利用可能な枠組みにまとめたことにある。動画モデルが単にもっともらしい映像を作るのではなく、特定の認知的規則を扱えるかを検証しやすくなる。
チームはデータ、試験、モデルの回答、スコア、重み、さらにAWS Trainium2向けのネイティブPyTorch訓練スタックであるPWMを公開した。今後の焦点は、学習した能力が未知の場面や実写映像、ロボットとの身体的な相互作用にも移転するかどうかである。
コメント
ログイン状態を確認中…
コメントを読み込み中…