記事一覧へ戻る
ロボティクス・フィジカルAI

τ₀-VLA、行動前に未来を比較するロボット基盤モデル

読了目安 3 分

長期的なロボット操作では、個々の動作を正確に実行するだけでは不十分です。複数の作業を正しい順序でつなぎ、途中までの進行状況を記憶しながら、次の一手を選ばなければなりません。従来の階層型ビジョン・言語・アクションモデルの多くは、各判断を一度のフォワードパスで処理します。そのため、難しい判断や失敗の影響が大きい判断に、追加の推論計算を割り当てる仕組みがありませんでした。

τ₀-VLA はこの前提を見直します。判断に迷う場合、ロボットが複数の可能な未来を比較してから行動を選ぶ、という考え方です。

高レベル計画と低レベル実行

τ₀-VLA は階層型のロボット基盤モデルです。高レベル方策は実行記憶を保持し、完了したサブタスクと現在の観測をもとに、次に行うべきサブタスクを提案します。判断が明確ならそのまま出力しますが、不確実性がある場合はテスト時に追加の計算を使い、複数の候補を生成します。

続いて世界モデルが、各候補を実行した場合に生じる視覚的な結果を予測します。高レベル方策は予測結果を比較して候補を決定し、選ばれたサブタスクを汎用的な低レベル VLA に渡します。低レベル方策は、複数のロボット実体にまたがって具体的な操作を実行します。これにより、作業の順序を考える役割と、細かな動作を制御する役割が分離されます。

実験で示されたこと

  • 低レベル方策は、異種の実世界ロボットデータ 40,115 時間とマルチモーダル協調学習によって訓練されました。
  • テスト時計算を選択的に増やすことで、ドメイン内および分布シフト環境における次サブタスク予測精度が 15〜24 ポイント向上しました。
  • 実世界評価には、13〜25 個の順序付きステップを含み、最長 12 分に及ぶエピソードが含まれます。
  • 4 つの長期操作タスクでは、同じ低レベル方策を使いながら、階層型計画によって平均閉ループ成功率が 27.5% から 45.0% に上昇しました。

意義と残る課題

τ₀-VLA の重要な点は、ロボット計画に「必要なときだけ考える」仕組みを導入したことです。長期タスクでは、初期のサブタスク選択を誤ると、後続の多くの操作に影響が及びます。候補を探索し、世界モデルで結果を確認することで、失敗コストの高い判断に計算資源を集中できます。

一方、追加計算があれば現実世界で必ず正しく動くわけではありません。効果は世界モデルの予測性能と低レベル方策の実行能力に依存し、予測された視覚結果が実際の環境と一致しない可能性もあります。そのため本研究は、長期操作のすべての問題を解決するものというより、ロボット基盤モデルの推論コストを状況に応じて拡張する設計を示したものです。公式コードと低レベル VLA の事前学習済みチェックポイントが公開され、高レベル方策は後日公開予定です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
MotorMind、汎用VLMによるゼロショットロボット操作を実現
ロボティクス・フィジカルAI
cctest.ai

MotorMind、汎用VLMによるゼロショットロボット操作を実現

MotorMindは、汎用の視覚言語モデルがロボットの観察、行動、実行確認を直接担えるかを検証する実行フレームワークです。中間レベルのアクションと非同期フィードバックを使い、専用ポリシーやコーディングエージェントに頼らない操作を目指します。

続きを読む
CCTest · Blog
Skill2Real:ロボット技能をシミュレーションから現実へ移す
ロボティクス・フィジカルAI
cctest.ai

Skill2Real:ロボット技能をシミュレーションから現実へ移す

Skill2Realは、タスクごとの方策を再学習するのではなく、共通APIを介して実行可能な操作技能を移行するエージェント型フレームワークを提案する。階層的な記憶と提案者・検証者・統括者のループにより、凍結した技能の実機利用を検証した。

続きを読む
CCTest · Blog
観測を減らすほど行動は改善する?PyRUA-Leanがロボットエージェントを効率化
ロボティクス・フィジカルAI
cctest.ai

観測を減らすほど行動は改善する?PyRUA-Leanがロボットエージェントを効率化

PyRUA-Leanは、ロボットのプリミティブをPythonセル内で組み合わせ、条件判定や局所的な再試行を実行するフレームワークです。700件のシミュレーションで、同じLLM呼び出し予算のもと成功率を63.1%から71.7%へ高め、両方式が解けたタスクでは入力トークンを65%削減しました。

続きを読む