RoboDawn、視覚言語モデルの推論をロボット制御へ移す
導入
視覚言語モデル(VLM)は、画像と言語を結び付けて高水準の指示を理解できるようになった。しかし、ロボットを実際に動かすには、空間関係の理解、視覚情報から実行可能な動作への変換、そして実行誤差への対応が必要になる。論文「Transferring the Intelligence of VLMs to Robotic Control」は、このデジタル世界と物理世界の隔たりに対し、RoboDawnというインターフェースを提案した。
制御を簡潔なアクション言語にする
RoboDawnは、VLMに連続的な関節軌道を直接出力させるのではなく、平行移動、回転、グリッパー操作からなるコンパクトな離散コマンドを与える。ロボットは現在の視覚状態を観察し、次の動作を推論して実行する。その後の状態を再び観察し、結果に応じて次の判断を更新する。この「観察・推論・実行・再観察」のループにより、最初に完全な軌道を作るのではなく、途中のずれを段階的に修正できる。
さらに、論文はロボット向けの文脈内学習を導入した。少数の実演は、コマンドの使い方を教えるだけでなく、タスクをどのような順序で解くかという戦略も示す。つまり、実演によってモデルは、見えている状況と次の動作、そして一連の操作の関係を推測しやすくなる。
実験結果
RoboTwin 2.0 C2Rでは、実演なしの成功率が53.2%、1回の文脈内実演を加えると73.6%となった。報告されたπ0.5ベースラインの46.0%も上回っている。より難しいRoboDojoでは、ゼロショット時の35.67%から、1回の実演後には47.17%へ向上した。これらの結果は、対象タスク専用に訓練したロボットポリシーに依存しない点でも重要である。
研究から読み取れる主な点は次の通りだ。
- RoboDojoで47%を超える成功率を達成し、長期的なマニピュレーションの比較基準を示した。
- 文脈内学習によって推論時にロボットの行動を改善でき、実演や相互作用履歴が具身エージェントに有効であることを示した。
- 推論または相互作用のステップ数を増やすと性能が伸び続ける傾向があり、テスト時スケーリングが観察された。
また、Franka実機では、ブロックをバスケットに入れる作業とブロック積み上げにも適用された。離散インターフェースがシミュレーションだけに限定されないことを示している。
意義と残された課題
RoboDawnの意義は、汎用VLMの視覚的推論と物理的な動作の間に、モデルが扱いやすい中間層を設けた点にある。タスクごとに大量のロボットデータを集める代わりに、一般モデルの知識や計画能力を再利用し、実演を通じて現場で適応できる可能性を示した。
一方、評価は限られたベンチマークと実機タスクを中心としている。より精密で高速な操作や安全性が重要な作業に離散コマンドが対応できるか、遮蔽、不確実な接触、誤差の累積に対して安定するかは今後の課題だ。それでも、簡潔な制御言語、段階的な行動、視覚フィードバックを組み合わせることで、デジタルな知能を物理世界へ接続する具体的な道筋を示している。
コメント
ログイン状態を確認中…
コメントを読み込み中…