Grounded Action Model:3Dグラウンディングをロボット制御の基盤に
導入
ロボットに「赤いカップを取って」と指示した場合、言語を理解するだけでは不十分です。ロボットは複数の物体から対象を特定し、その物体が3次元空間のどこにあるかを把握し、どの方向からアームを近づけるかまで決めなければなりません。しかし、現在のロボット基盤モデルの多くは、視覚言語モデルや動画生成モデルを基盤としており、計量的な空間グラウンディングを直接の学習目標にはしていません。そのため、物体と正確な位置の対応付けは、ロボットの実演データから暗黙的に学習されることが一般的です。
今回提案された Grounded Action Model(GAM)は、3Dグラウンディングを行動モデルの中心に据えるアプローチです。
対象物を中心にした共通表現
GAMは、自然言語、点プロンプト、ボックスプロンプトの3種類の入力に対応します。入力された指示は、選択された対象物を表す共通の物体中心表現へ変換されます。この表現には、対象に焦点を当てた視覚特徴だけでなく、物体の3D位置や幾何形状に関する計量情報も含まれます。
その後、対象物の表現はロボットの状態履歴とともに、マルチストリームTransformerへ入力されます。GAMは単一の制御値だけでなく、連続したアクションチャンクを予測するため、接近、把持、移動、配置といった一連の操作を扱いやすくなっています。また、GAMは単独で動作できるだけでなく、高レベルプランナーから指示を受ける低レベルコントローラーとしても利用できます。プランナーは言語、点、ボックスなどの形式で対象を指定でき、長い手順や過去の状態に依存する作業にも対応する構成です。
ベンチマークで示された効果
RoboTwin 2.0の50タスクでは、GAMの平均成功率は55.3%で、Spatial Forcingの52.0%を上回りました。シーンをランダム化した条件では47.6%を達成し、Abot-M0の30.4%を上回っています。しかも、GAMの行動ポリシーはクリーンなシーンで収集されたデモンストレーションだけで訓練されています。明示的な物体ジオメトリが、見た目の変化への適応を支えた可能性があります。
LIBERO-PROでも、16種類の摂動条件における平均成功率は61%で、π₀.₅の53%を上回りました。特に、対象物の位置が移動した場合や、作業中に新しい対象が指定された場合に大きな差が報告されています。固定されたシーンを記憶するのではなく、現在の指示と対象の位置を再び結び付ける能力が有効だったと考えられます。
実機では、視覚条件が変化する双腕YAMで20回中17回の成功を維持し、π₀.₅は4回でした。さらにFranka上でMolmo2プランナーと組み合わせた場合、長期的かつ記憶依存のタスクで、同一分布のステップ完了率64.7%、分布外では49.8%が報告されています。
意義と今後の課題
GAMの重要な点は、計画と制御の役割を明確に分けられることです。高レベルモデルが「何を操作するか」を決め、GAMが対象物の3D情報を使って「どこへ、どのように動くか」を実行します。これにより、すべてをデモンストレーションから推測する単一ポリシーより、対象移動や視覚変化に対応しやすくなる可能性があります。
一方、結果は特定のベンチマークと限られた実機評価に基づくもので、遮蔽の多い環境、新規物体、繊細な接触操作、長い手順中の失敗回復まで解決したことを示すものではありません。それでもGAMは、具身AIでは言語や画像表現だけでなく、明示的で計量可能な空間理解も基盤機能として扱うべきだという方向性を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…