記事一覧へ戻る
ロボティクス・フィジカルAI

MotorMind、汎用VLMによるゼロショットロボット操作を実現

読了目安 3 分

背景

未知の環境でロボットを動かすには、指示を理解するだけでは不十分です。ロボットは視覚情報から実行可能な動作を選び、動作の結果を確認し、失敗や環境の変化に応じて次の行動を修正しなければなりません。視覚言語行動モデル(VLA)はこの分野を前進させましたが、多くの場合、特定タスク向けのデータやポリシー学習に依存しています。そのため、新しいタスクや環境でのゼロショット一般化には限界があります。

一方、汎用の視覚言語モデル(VLM)を高レベル推論に使い、コーディングエージェント、行動エキスパート、追加のグラウンディングツールでロボットを制御する方法もあります。しかし、外部モデルやツールが増えるほど、システムは複雑になり、コストも上昇します。MotorMindは、VLMそのものを人間の遠隔操作に近い形でロボットの操作ループへ組み込めるかを検討します。

仕組み

MotorMindは、VLMに関節レベルの制御信号を直接生成させません。モデルは現在の観察をもとに、中間レベルのアクションを提案します。その提案を決定論的なロボット制御器が実行し、実行中の状態や視覚的な変化を監視します。新しいフィードバックは再びモデルへ渡され、観察、行動、確認、修正のサイクルが続きます。

主な設計は次の通りです。

  • 中間レベルのアクション表現:モデルの柔軟な推論と低レベル制御の間をつなぎます。
  • 非同期モニタリング:動作の実行と進捗確認を並行させ、異常への対応を早めます。
  • バックグラウンドのメモリー更新:実行中に得た情報を後続の判断に反映します。
  • 外部依存の削減:専用ポリシー学習、コーディングエージェント、SAM3のような追加ツールを使わない構成です。

結果と限界

LIBERO-PROの基本スイートでは66.7%、摂動を加えた条件では53.8%の成功率を報告しています。比較対象となった従来のゼロショット手法は、それぞれ最大13.3%、19.2%でした。実機のxArm6では、直接操作と人による妨害を含む条件で平均95%の成功率に達しました。また、より強力なVLMをバックボーンに使うことで性能はさらに向上しました。

ただし、この結果は汎用VLMがロボット操作を解決したことを意味しません。失敗の中心は、対象の正確な位置を把握する視覚的グラウンディング、接触や物理的結果を理解する身体性推論、そして適切な動作を選ぶための行動知識です。物体を認識できても、どこをどのように掴むべきかを正確に判断できるとは限りません。

意義

MotorMindは、VLMとロボット制御器の役割を分ける設計を示しています。VLMは観察に基づく柔軟な判断を担い、決定論的な制御器はその意図をより安定した動作へ変換します。この構成により、モデルにすべての低レベル制御を任せずに、汎用VLMの転移能力を活用できます。

今後は、安全制約、失敗からの復旧、長時間タスクでの評価が重要になります。MotorMindは、汎用VLMをロボットの直接的な操作主体にできる可能性を示す一方、実環境で安定して働く汎用ロボットエージェントには、なお改善の余地があることも明確にしています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Skill2Real:ロボット技能をシミュレーションから現実へ移す
ロボティクス・フィジカルAI
cctest.ai

Skill2Real:ロボット技能をシミュレーションから現実へ移す

Skill2Realは、タスクごとの方策を再学習するのではなく、共通APIを介して実行可能な操作技能を移行するエージェント型フレームワークを提案する。階層的な記憶と提案者・検証者・統括者のループにより、凍結した技能の実機利用を検証した。

続きを読む
CCTest · Blog
観測を減らすほど行動は改善する?PyRUA-Leanがロボットエージェントを効率化
ロボティクス・フィジカルAI
cctest.ai

観測を減らすほど行動は改善する?PyRUA-Leanがロボットエージェントを効率化

PyRUA-Leanは、ロボットのプリミティブをPythonセル内で組み合わせ、条件判定や局所的な再試行を実行するフレームワークです。700件のシミュレーションで、同じLLM呼び出し予算のもと成功率を63.1%から71.7%へ高め、両方式が解けたタスクでは入力トークンを65%削減しました。

続きを読む
CCTest · Blog
ロボットは記憶だけでは足りない:変化する世界を進むEvolvingNav
ロボティクス・フィジカルAI
cctest.ai

ロボットは記憶だけでは足りない:変化する世界を進むEvolvingNav

ロボットが向かっている間に、記憶された物体の位置が変わることがあります。EvolvingNavは、時間付き3D記憶と確率的な信念更新を組み合わせ、変化する環境でのナビゲーションを目指します。

続きを読む