記事一覧へ戻る
世界モデル

InternW0-Δ:2万時間超のオープンデータで視覚予測とロボット行動を統合

読了目安 3 分

はじめに

実環境でロボットが物体をつかみ、動かし、整理するには、現在の映像に反応するだけでは不十分です。行動によって周囲がどう変わるか、どの視覚情報が次の操作に重要かを予測する必要があります。InternW0-Δは、この視覚的な予測能力と行動生成を一つのWorld Action Model(WAM)にまとめ、汎用的なロボット操作を目指す研究です。

主なポイント

  • 複数の事前知識を統合。 Mixture-of-Transformersの構成により、事前学習済みの視覚ダイナミクス、シーンレベルの意味情報、4Dの幾何・運動事前分布、行動生成を組み合わせます。動画エキスパートが視覚変化を扱い、行動エキスパートが制御行動を生成し、凍結した視覚言語モデルが意味的なガイダンスを提供します。
  • 未来動画を推論時に生成しない。 提案するCausal Imprintは、訓練時に未来の観測を使って、後続の行動に関係するシーン変化を学習します。推論時には、その予測表現を行動エキスパートへ直接渡すため、行動前に未来動画を逐次ロールアウトする必要がありません。
  • 異なるデータ源を共通表現で整備。 ロボット実演、UMIデータ、人間の一人称実演、Ego2Robotデータを、共通の状態・行動表現にそろえています。論文によれば、処理後の訓練コーパスは2万時間を超え、同種のオープンソースコーパスとして最大規模とされています。
  • シミュレーションと実機を評価。 著者らは、複数のシミュレーションベンチマークと実ロボットプラットフォームで、従来手法を上回る性能を報告しています。ただし、提供された素材には具体的な成功率、ハードウェア構成、比較手法の詳細は含まれていません。

意義と今後の論点

この研究の中心的な意義は、世界モデルと制御ポリシーの分断を縮めようとしている点です。視覚ダイナミクスモデルは世界の変化を説明できますが、必ずしも次の行動を決められるとは限りません。一方、行動ポリシーは制御信号を出せても、その結果として生じる未来を十分に表現できない場合があります。InternW0-Δは、両者を同じ枠組みで相互作用させ、意味情報や幾何情報を介して知覚と操作を結び付けます。

Causal Imprintは、実装面での割り切りも示しています。未来情報は訓練時に表現学習へ利用しますが、実運用では未来フレームを何度も生成してから行動する必要をなくします。これによりオンライン推論を簡素化できる可能性がありますが、遮蔽、分布変化、長期タスクでの安定性は今後の検証課題です。

コード、重み、基盤、データ処理パイプライン、そしてライセンスが許す範囲で処理済みデータが公開されれば、再現実験やデータ源ごとの比較を促せます。ただし、データ量だけで汎化が保証されるわけではありません。ラベルの一貫性、ロボット形態の違い、実機導入コストが、汎用的な世界行動モデルの実用性を左右します。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
世界モデルに「物体の永続性」を学習させるWROP
世界モデル
cctest.ai
世界モデル

世界モデルに「物体の永続性」を学習させるWROP

新研究は、認知科学に着想を得た150種類の課題と150万サンプルを用いて、動画モデルに遮蔽後の物体の連続性を学習させる。16BのPWM-WROPは動画継続モデルで首位となったが、結果は専用ベンチマーク上の評価である。

続きを読む
CCTest · Blog
HappyWorld-Bench、世界モデルの「対話後も壊れない信頼性」を評価
世界モデル
cctest.ai
世界モデル

HappyWorld-Bench、世界モデルの「対話後も壊れない信頼性」を評価

HappyWorld-Benchは、動画・空間・身体性世界モデルを対象に、見た目のリアリティだけでなく、探索や行動、編集後の状態一貫性を測定するベンチマークです。長期展開、シーン編集、複数ステップの行動で、現在のモデルが抱える信頼性の課題を示しました。

続きを読む