記事一覧へ戻る
ロボティクス・フィジカルAI

Grounded Action Model:3Dグラウンディングをロボット制御の基盤に

読了目安 4 分

導入

ロボットに「赤いカップを取って」と指示した場合、言語を理解するだけでは不十分です。ロボットは複数の物体から対象を特定し、その物体が3次元空間のどこにあるかを把握し、どの方向からアームを近づけるかまで決めなければなりません。しかし、現在のロボット基盤モデルの多くは、視覚言語モデルや動画生成モデルを基盤としており、計量的な空間グラウンディングを直接の学習目標にはしていません。そのため、物体と正確な位置の対応付けは、ロボットの実演データから暗黙的に学習されることが一般的です。

今回提案された Grounded Action Model(GAM)は、3Dグラウンディングを行動モデルの中心に据えるアプローチです。

対象物を中心にした共通表現

GAMは、自然言語、点プロンプト、ボックスプロンプトの3種類の入力に対応します。入力された指示は、選択された対象物を表す共通の物体中心表現へ変換されます。この表現には、対象に焦点を当てた視覚特徴だけでなく、物体の3D位置や幾何形状に関する計量情報も含まれます。

その後、対象物の表現はロボットの状態履歴とともに、マルチストリームTransformerへ入力されます。GAMは単一の制御値だけでなく、連続したアクションチャンクを予測するため、接近、把持、移動、配置といった一連の操作を扱いやすくなっています。また、GAMは単独で動作できるだけでなく、高レベルプランナーから指示を受ける低レベルコントローラーとしても利用できます。プランナーは言語、点、ボックスなどの形式で対象を指定でき、長い手順や過去の状態に依存する作業にも対応する構成です。

ベンチマークで示された効果

RoboTwin 2.0の50タスクでは、GAMの平均成功率は55.3%で、Spatial Forcingの52.0%を上回りました。シーンをランダム化した条件では47.6%を達成し、Abot-M0の30.4%を上回っています。しかも、GAMの行動ポリシーはクリーンなシーンで収集されたデモンストレーションだけで訓練されています。明示的な物体ジオメトリが、見た目の変化への適応を支えた可能性があります。

LIBERO-PROでも、16種類の摂動条件における平均成功率は61%で、π₀.₅の53%を上回りました。特に、対象物の位置が移動した場合や、作業中に新しい対象が指定された場合に大きな差が報告されています。固定されたシーンを記憶するのではなく、現在の指示と対象の位置を再び結び付ける能力が有効だったと考えられます。

実機では、視覚条件が変化する双腕YAMで20回中17回の成功を維持し、π₀.₅は4回でした。さらにFranka上でMolmo2プランナーと組み合わせた場合、長期的かつ記憶依存のタスクで、同一分布のステップ完了率64.7%、分布外では49.8%が報告されています。

意義と今後の課題

GAMの重要な点は、計画と制御の役割を明確に分けられることです。高レベルモデルが「何を操作するか」を決め、GAMが対象物の3D情報を使って「どこへ、どのように動くか」を実行します。これにより、すべてをデモンストレーションから推測する単一ポリシーより、対象移動や視覚変化に対応しやすくなる可能性があります。

一方、結果は特定のベンチマークと限られた実機評価に基づくもので、遮蔽の多い環境、新規物体、繊細な接触操作、長い手順中の失敗回復まで解決したことを示すものではありません。それでもGAMは、具身AIでは言語や画像表現だけでなく、明示的で計量可能な空間理解も基盤機能として扱うべきだという方向性を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
RoboDawn、視覚言語モデルの推論をロボット制御へ移す
ロボティクス・フィジカルAI
cctest.ai

RoboDawn、視覚言語モデルの推論をロボット制御へ移す

RoboDawnは、平行移動・回転・グリッパー操作を離散コマンドにまとめ、エージェント型の視覚言語モデルからロボットを制御する仕組みを提案する。閉ループ制御と少数の実演により、シミュレーションと実機の双方で性能向上を示した。

続きを読む
CCTest · Blog
世界モデルのように考え、VLAの速度で動くロボット方策
ロボティクス・フィジカルAI
cctest.ai

世界モデルのように考え、VLAの速度で動くロボット方策

新研究は、将来状態の予測を制御ループに持ち込まず、世界モデルの内部表現だけを小型VLAへ蒸留する手法を提案した。推論コストを増やさず、ロボット操作性能の向上を目指す。

続きを読む
CCTest · Blog
明示的な軌道なしで先読みする3D拡散ポリシー
ロボティクス・フィジカルAI
cctest.ai

明示的な軌道なしで先読みする3D拡散ポリシー

短い観測履歴からインタラクションの進行方向を表す潜在表現を学習し、3D拡散ポリシーに先読み能力を加える手法が提案された。完全な軌道計画を導入せず、DP3の枠組みを維持したまま性能向上を報告している。

続きを読む