記事一覧へ戻る
ロボティクス・フィジカルAI

RoboDawn、視覚言語モデルの推論をロボット制御へ移す

読了目安 3 分

導入

視覚言語モデル(VLM)は、画像と言語を結び付けて高水準の指示を理解できるようになった。しかし、ロボットを実際に動かすには、空間関係の理解、視覚情報から実行可能な動作への変換、そして実行誤差への対応が必要になる。論文「Transferring the Intelligence of VLMs to Robotic Control」は、このデジタル世界と物理世界の隔たりに対し、RoboDawnというインターフェースを提案した。

制御を簡潔なアクション言語にする

RoboDawnは、VLMに連続的な関節軌道を直接出力させるのではなく、平行移動、回転、グリッパー操作からなるコンパクトな離散コマンドを与える。ロボットは現在の視覚状態を観察し、次の動作を推論して実行する。その後の状態を再び観察し、結果に応じて次の判断を更新する。この「観察・推論・実行・再観察」のループにより、最初に完全な軌道を作るのではなく、途中のずれを段階的に修正できる。

さらに、論文はロボット向けの文脈内学習を導入した。少数の実演は、コマンドの使い方を教えるだけでなく、タスクをどのような順序で解くかという戦略も示す。つまり、実演によってモデルは、見えている状況と次の動作、そして一連の操作の関係を推測しやすくなる。

実験結果

RoboTwin 2.0 C2Rでは、実演なしの成功率が53.2%、1回の文脈内実演を加えると73.6%となった。報告されたπ0.5ベースラインの46.0%も上回っている。より難しいRoboDojoでは、ゼロショット時の35.67%から、1回の実演後には47.17%へ向上した。これらの結果は、対象タスク専用に訓練したロボットポリシーに依存しない点でも重要である。

研究から読み取れる主な点は次の通りだ。

  • RoboDojoで47%を超える成功率を達成し、長期的なマニピュレーションの比較基準を示した。
  • 文脈内学習によって推論時にロボットの行動を改善でき、実演や相互作用履歴が具身エージェントに有効であることを示した。
  • 推論または相互作用のステップ数を増やすと性能が伸び続ける傾向があり、テスト時スケーリングが観察された。

また、Franka実機では、ブロックをバスケットに入れる作業とブロック積み上げにも適用された。離散インターフェースがシミュレーションだけに限定されないことを示している。

意義と残された課題

RoboDawnの意義は、汎用VLMの視覚的推論と物理的な動作の間に、モデルが扱いやすい中間層を設けた点にある。タスクごとに大量のロボットデータを集める代わりに、一般モデルの知識や計画能力を再利用し、実演を通じて現場で適応できる可能性を示した。

一方、評価は限られたベンチマークと実機タスクを中心としている。より精密で高速な操作や安全性が重要な作業に離散コマンドが対応できるか、遮蔽、不確実な接触、誤差の累積に対して安定するかは今後の課題だ。それでも、簡潔な制御言語、段階的な行動、視覚フィードバックを組み合わせることで、デジタルな知能を物理世界へ接続する具体的な道筋を示している。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Grounded Action Model:3Dグラウンディングをロボット制御の基盤に
ロボティクス・フィジカルAI
cctest.ai

Grounded Action Model:3Dグラウンディングをロボット制御の基盤に

Grounded Action Model(GAM)は、物体の3D位置や形状を明示的に取り込んでロボットの行動を予測するモデルです。言語、点、ボックスによる指示を共通の物体中心表現に変換することで、対象物の移動や視覚的な環境変化に対する頑健性を高めます。

続きを読む
CCTest · Blog
世界モデルのように考え、VLAの速度で動くロボット方策
ロボティクス・フィジカルAI
cctest.ai

世界モデルのように考え、VLAの速度で動くロボット方策

新研究は、将来状態の予測を制御ループに持ち込まず、世界モデルの内部表現だけを小型VLAへ蒸留する手法を提案した。推論コストを増やさず、ロボット操作性能の向上を目指す。

続きを読む
CCTest · Blog
明示的な軌道なしで先読みする3D拡散ポリシー
ロボティクス・フィジカルAI
cctest.ai

明示的な軌道なしで先読みする3D拡散ポリシー

短い観測履歴からインタラクションの進行方向を表す潜在表現を学習し、3D拡散ポリシーに先読み能力を加える手法が提案された。完全な軌道計画を導入せず、DP3の枠組みを維持したまま性能向上を報告している。

続きを読む