InternW0-Δ:2万時間超のオープンデータで視覚予測とロボット行動を統合
はじめに
実環境でロボットが物体をつかみ、動かし、整理するには、現在の映像に反応するだけでは不十分です。行動によって周囲がどう変わるか、どの視覚情報が次の操作に重要かを予測する必要があります。InternW0-Δは、この視覚的な予測能力と行動生成を一つのWorld Action Model(WAM)にまとめ、汎用的なロボット操作を目指す研究です。
主なポイント
- 複数の事前知識を統合。 Mixture-of-Transformersの構成により、事前学習済みの視覚ダイナミクス、シーンレベルの意味情報、4Dの幾何・運動事前分布、行動生成を組み合わせます。動画エキスパートが視覚変化を扱い、行動エキスパートが制御行動を生成し、凍結した視覚言語モデルが意味的なガイダンスを提供します。
- 未来動画を推論時に生成しない。 提案するCausal Imprintは、訓練時に未来の観測を使って、後続の行動に関係するシーン変化を学習します。推論時には、その予測表現を行動エキスパートへ直接渡すため、行動前に未来動画を逐次ロールアウトする必要がありません。
- 異なるデータ源を共通表現で整備。 ロボット実演、UMIデータ、人間の一人称実演、Ego2Robotデータを、共通の状態・行動表現にそろえています。論文によれば、処理後の訓練コーパスは2万時間を超え、同種のオープンソースコーパスとして最大規模とされています。
- シミュレーションと実機を評価。 著者らは、複数のシミュレーションベンチマークと実ロボットプラットフォームで、従来手法を上回る性能を報告しています。ただし、提供された素材には具体的な成功率、ハードウェア構成、比較手法の詳細は含まれていません。
意義と今後の論点
この研究の中心的な意義は、世界モデルと制御ポリシーの分断を縮めようとしている点です。視覚ダイナミクスモデルは世界の変化を説明できますが、必ずしも次の行動を決められるとは限りません。一方、行動ポリシーは制御信号を出せても、その結果として生じる未来を十分に表現できない場合があります。InternW0-Δは、両者を同じ枠組みで相互作用させ、意味情報や幾何情報を介して知覚と操作を結び付けます。
Causal Imprintは、実装面での割り切りも示しています。未来情報は訓練時に表現学習へ利用しますが、実運用では未来フレームを何度も生成してから行動する必要をなくします。これによりオンライン推論を簡素化できる可能性がありますが、遮蔽、分布変化、長期タスクでの安定性は今後の検証課題です。
コード、重み、基盤、データ処理パイプライン、そしてライセンスが許す範囲で処理済みデータが公開されれば、再現実験やデータ源ごとの比較を促せます。ただし、データ量だけで汎化が保証されるわけではありません。ラベルの一貫性、ロボット形態の違い、実機導入コストが、汎用的な世界行動モデルの実用性を左右します。
コメント
ログイン状態を確認中…
コメントを読み込み中…