記事一覧へ戻る
世界モデル

世界モデルに「物体の永続性」を学習させるWROP

読了目安 3 分

物体の永続性を動画モデルで測る

ボールが遮蔽物の後ろに消えても、人間は通常、それが消滅したのではなく、遮蔽物の向こう側に存在し続けていると考える。この「物体の永続性」は、場面の連続性を理解し、物理的な動きを予測し、行動を計画するための基礎となる。

論文「Training Object Permanence in World Models」は、現在の動画生成モデルがこの能力をすでに持つのか、また不足しているなら専用データで訓練できるのかを調べた研究だ。

認知課題を大規模データへ変換

研究チームはWROP(World Reasoning with Object Permanence)を提案した。これは認知科学に着想を得て設計した150の課題からなるデータ基盤で、課題は6つの認知カテゴリーに分けられている。対象となるのは、遮蔽された物体の存在、動きの連続性、物体の固体性などに関わる推論だ。

各課題にはBlenderベースのデータ生成器が用意されている。速度、照明、カメラ角度などの表面的な条件をランダム化しつつ、課題が問う認知構造は維持する。これにより、モデルが決まった画面や動きのパターンを暗記するだけでは対応しにくくなり、遮蔽や位置変化、物体同一性といった関係に注目することが期待される。

各課題から1万件以上のサンプルを生成でき、全体で150万サンプルの訓練コーパスが構築された。さらに、比較評価用として300問の試験も公開されている。

PWM-WROPの評価結果

研究では、参照画像から動画を生成するモデル3種、動画編集モデル7種、動画継続モデル4種の計14モデルを評価した。その中には、160億パラメータの世界モデルPWM-WROPも含まれる。

盲検のペア比較をEloスコアに集約した結果、PWM-WROPは動画継続モデルの中で1位、全体では3位となった。上位2モデルは参照画像から動画を生成するモデルで、両者の差は統計的には同点だった。

この結果は、認知科学の概念を中心にデータを設計すれば、対応する世界モデル課題の性能を改善できる可能性を示す。ただし、WROPでの成功をそのまま一般的な物理理解や人間レベルの推論と見なすことはできない。評価対象は、設計された合成タスクとその試験に限定されているためだ。

研究の意義

WROPの重要な点は、課題設計、手続き的なデータ生成、訓練コーパス、評価試験を一つの再利用可能な枠組みにまとめたことにある。動画モデルが単にもっともらしい映像を作るのではなく、特定の認知的規則を扱えるかを検証しやすくなる。

チームはデータ、試験、モデルの回答、スコア、重み、さらにAWS Trainium2向けのネイティブPyTorch訓練スタックであるPWMを公開した。今後の焦点は、学習した能力が未知の場面や実写映像、ロボットとの身体的な相互作用にも移転するかどうかである。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
HappyWorld-Bench、世界モデルの「対話後も壊れない信頼性」を評価
世界モデル
cctest.ai
世界モデル

HappyWorld-Bench、世界モデルの「対話後も壊れない信頼性」を評価

HappyWorld-Benchは、動画・空間・身体性世界モデルを対象に、見た目のリアリティだけでなく、探索や行動、編集後の状態一貫性を測定するベンチマークです。長期展開、シーン編集、複数ステップの行動で、現在のモデルが抱える信頼性の課題を示しました。

続きを読む
CCTest · Blog
InternW0、予測から実行可能な制御へ進む物理世界モデル
世界モデル
cctest.ai
世界モデル

InternW0、予測から実行可能な制御へ進む物理世界モデル

上海人工知能研究所が、将来の映像ダイナミクスと連続ロボット制御を統合する物理世界モデル InternW0 を発表した。非同期処理、部分観測、異なるロボット形態、接触を伴う科学作業を主な対象とする。

続きを読む
CCTest · Blog
GAE:3D整合性の高い世界生成に向けた幾何ネイティブ潜在空間
世界モデル
cctest.ai
世界モデル

GAE:3D整合性の高い世界生成に向けた幾何ネイティブ潜在空間

GAEは、3D整合性の問題を生成器だけでなく表現の問題として捉え直します。外観、深度、カメラ、3D点マップを同時に復元できる潜在表現により、視点をまたいだ一貫性を生成過程に組み込みます。

続きを読む