MotorMind、汎用VLMによるゼロショットロボット操作を実現
背景
未知の環境でロボットを動かすには、指示を理解するだけでは不十分です。ロボットは視覚情報から実行可能な動作を選び、動作の結果を確認し、失敗や環境の変化に応じて次の行動を修正しなければなりません。視覚言語行動モデル(VLA)はこの分野を前進させましたが、多くの場合、特定タスク向けのデータやポリシー学習に依存しています。そのため、新しいタスクや環境でのゼロショット一般化には限界があります。
一方、汎用の視覚言語モデル(VLM)を高レベル推論に使い、コーディングエージェント、行動エキスパート、追加のグラウンディングツールでロボットを制御する方法もあります。しかし、外部モデルやツールが増えるほど、システムは複雑になり、コストも上昇します。MotorMindは、VLMそのものを人間の遠隔操作に近い形でロボットの操作ループへ組み込めるかを検討します。
仕組み
MotorMindは、VLMに関節レベルの制御信号を直接生成させません。モデルは現在の観察をもとに、中間レベルのアクションを提案します。その提案を決定論的なロボット制御器が実行し、実行中の状態や視覚的な変化を監視します。新しいフィードバックは再びモデルへ渡され、観察、行動、確認、修正のサイクルが続きます。
主な設計は次の通りです。
- 中間レベルのアクション表現:モデルの柔軟な推論と低レベル制御の間をつなぎます。
- 非同期モニタリング:動作の実行と進捗確認を並行させ、異常への対応を早めます。
- バックグラウンドのメモリー更新:実行中に得た情報を後続の判断に反映します。
- 外部依存の削減:専用ポリシー学習、コーディングエージェント、SAM3のような追加ツールを使わない構成です。
結果と限界
LIBERO-PROの基本スイートでは66.7%、摂動を加えた条件では53.8%の成功率を報告しています。比較対象となった従来のゼロショット手法は、それぞれ最大13.3%、19.2%でした。実機のxArm6では、直接操作と人による妨害を含む条件で平均95%の成功率に達しました。また、より強力なVLMをバックボーンに使うことで性能はさらに向上しました。
ただし、この結果は汎用VLMがロボット操作を解決したことを意味しません。失敗の中心は、対象の正確な位置を把握する視覚的グラウンディング、接触や物理的結果を理解する身体性推論、そして適切な動作を選ぶための行動知識です。物体を認識できても、どこをどのように掴むべきかを正確に判断できるとは限りません。
意義
MotorMindは、VLMとロボット制御器の役割を分ける設計を示しています。VLMは観察に基づく柔軟な判断を担い、決定論的な制御器はその意図をより安定した動作へ変換します。この構成により、モデルにすべての低レベル制御を任せずに、汎用VLMの転移能力を活用できます。
今後は、安全制約、失敗からの復旧、長時間タスクでの評価が重要になります。MotorMindは、汎用VLMをロボットの直接的な操作主体にできる可能性を示す一方、実環境で安定して働く汎用ロボットエージェントには、なお改善の余地があることも明確にしています。
コメント
ログイン状態を確認中…
コメントを読み込み中…