記事一覧へ戻る
ロボティクス・フィジカルAI

MobileVLA-R1 2.0、強化学習でロボットの推論と行動を接続

読了目安 3 分

導入

「指定した場所へ移動して作業を完了して」と指示を理解できても、ロボットがそれを安定して実行できるとは限らない。移動ロボットには、言語と視覚の理解に加え、長い行動系列の計画、歩行、物体操作、そして実行結果に応じた制御が必要になる。MobileVLA-R1 2.0は、この高レベルの意味理解と身体的な実行の間にある隔たりを埋めようとする研究である。

主なポイント

  • 推論を訓練過程に明示的に組み込む。 観測から行動への暗黙的な写像だけに依存せず、教師ありChain-of-Thought(CoT)整合と強化学習を使い、時間軸やタスク粒度の異なる軌道推論を学習する。
  • 意思決定と機体制御を分離する。 マルチモーダルな推論表現からタスクレベルの行動目標を生成し、その後にロボット固有のコントローラが実行可能な命令へ変換する。高レベルモデルとアクチュエータの詳細を切り離しながら、共通の知覚・推論・行動インターフェースを構成する。
  • 複数のロボット形態を対象にする。 言語指示ナビゲーション、四脚ロボット制御、人型ロボットによる移動マニピュレーションを評価し、VLN-CE、QUARD、Unitree Go2とG1の実世界展開を扱う。
  • 長期タスクでの改善を報告する。 VLN-CEではMobileVLA-R1に対して平均SRが1.6ポイント向上し、実世界のG1移動マニピュレーションでは完全タスク成功率が10.0ポイント向上したとされる。

意義と影響

この研究のポイントは、VLAモデルに思考過程を付け加えることだけではない。中間的な推論を、ロボットの軌道、タスク目標、閉ループ制御と結び付けようとしている点にある。長期タスクでは、各ステップを独立して予測するよりも、現在の行動が全体の目的にどう関係するかを維持しやすくなる可能性がある。

また、タスクレベルの目標と機体固有の制御を分離する設計は、異なる身体構造やアクチュエータを持つロボットへ高レベルモデルを展開するうえで有用な考え方だ。一方、要約で示されているのは主に全体的な改善値であり、詳細なベンチマーク内訳、学習コスト、失敗事例は明らかではない。未知環境への汎化や推論負荷、実運用での安定性は、本文と実装を確認する必要がある。

総じてMobileVLA-R1 2.0は、「何をすべきか」という推論と「実際に成功できる行動」のずれを、強化学習で小さくする方向を示している。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
汎用エージェントがロボットを直接操作する「Agent as Policy」
ロボティクス・フィジカルAI
cctest.ai

汎用エージェントがロボットを直接操作する「Agent as Policy」

Agent as Policyは、汎用的なコーディングエージェントを実物のロボットに接続し、視覚観察から実行可能なプログラムを作成して動作を指示する仕組みです。現実の結果を再び読み取り、次の行動を修正することで、専用訓練なしの操作を目指します。

続きを読む
CCTest · Blog
PhysBrain 1.5、認識・行動生成・未来予測を一つのモデルに統合
ロボティクス・フィジカルAI
cctest.ai

PhysBrain 1.5、認識・行動生成・未来予測を一つのモデルに統合

PhysBrain 1.5は、視覚言語モデルを物理環境の理解、エンドエフェクタの動作生成、未来状態の予測まで扱う具身基盤モデルへ拡張する試みです。論文によれば、8Bモデルは28件の具身理解ベンチマークで平均72.5点を達成しました。

続きを読む
CCTest · Blog
ロボットの視覚的な近道を断つ、LITによる行動モデルの汎化
ロボティクス・フィジカルAI
cctest.ai

ロボットの視覚的な近道を断つ、LITによる行動モデルの汎化

ロボット基盤モデルは、見慣れた環境では高い性能を示しても、行動と偶然結び付いた視覚的手掛かりに依存することがあります。Latent Interface Training(LIT)は、空間目標に基づく行動事前分布と姿勢監督付き潜在インターフェースによって、視覚分布の変化に対する頑健性を高めます。

続きを読む