記事一覧へ戻る
ロボティクス・フィジカルAI

Skill2Real:ロボット技能をシミュレーションから現実へ移す

読了目安 3 分

ロボットをシミュレーションから実環境へ移す際の難しさは、単に動作を学習させることではない。視覚情報、接触や動力学、さらにロボットの身体構成が変わっても、学習した知識を使い続けられる必要がある。Skill2Realは、この問題をタスク方策の再学習ではなく、再利用可能な実行技能とその記憶の移行として捉える。

手法の要点

中心となるのは、ロボットを操作する共通のアプリケーション・プログラミング・インターフェース(API)である。技能はシミュレータ内部の隠れた状態に直接依存せず、公開観測とAPIの意味に基づいて表現される。これにより、環境や身体構成が変わっても、技能の境界を保ちやすくする。

学習には、提案者・検証者・統括者(Proposer–Verifier–Governor、PVG)のループを用いる。提案者は技能を生成または修正し、検証者はシミュレーションで得られる特権的な証拠を利用して、結果の成否や失敗原因を調べる。統括者は更新を採用するか、技能記憶をどのように変化させるかを判断する。つまり、試行錯誤を繰り返すだけでなく、シミュレーションの診断情報を更新の審査に組み込む設計だ。

能力は二層に分けられる。まず「小脳」が局所的な操作技能を学習し、その後、「脳」が小脳を凍結した状態で、技能をタスクの手順に組み合わせる。最終的には両方の記憶を実機へ移し、タスク方策の微調整や技能記憶の更新を行わない。

報告された結果

  • GPT-5.6 SolがLIBERO-90で技能を学習し、GPT-6 Astraが凍結チェックポイントを評価した場合、LIBERO-Pro Longの成功率は2.0%から56.3%へ上昇した。Pro Long自体での訓練は行っていない。
  • Robosuiteの7タスクで独立に学習した場合、平均成功率はSolで85.1%、Opus 5で89.4%だった。
  • SolでLIBERO-90から学習した凍結技能は、Astraによる実行で、4つの実世界操作タスクにおいて平均78.75%の完了率を達成した。
  • VerifierまたはGovernorを除くと、最終的なPro Long成功率はそれぞれ17.3ポイント、13.3ポイント低下した。

意義と残る課題

Skill2Realの意義は、sim-to-realを「タスクごとにエンドツーエンド方策を作り直す問題」から、「共通インターフェースを通じて、検査可能で組み合わせ可能な技能を移す問題」へ置き換えた点にある。APIは環境間の抽象層となり、階層構造は運動の実行とタスク構成を分離する。PVGは、実機では集めにくい診断情報をシミュレーションで活用する。

一方、結果は記載されたベンチマーク、モデル構成、4つの実機タスクの範囲で解釈する必要がある。APIの設計、観測の品質、シミュレーションと実機の差が、転移性能に影響する可能性も残る。より多様なロボット、長い操作系列、開放的なタスクで同じ効果が得られるかは今後の検証課題である。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
MotorMind、汎用VLMによるゼロショットロボット操作を実現
ロボティクス・フィジカルAI
cctest.ai

MotorMind、汎用VLMによるゼロショットロボット操作を実現

MotorMindは、汎用の視覚言語モデルがロボットの観察、行動、実行確認を直接担えるかを検証する実行フレームワークです。中間レベルのアクションと非同期フィードバックを使い、専用ポリシーやコーディングエージェントに頼らない操作を目指します。

続きを読む
CCTest · Blog
観測を減らすほど行動は改善する?PyRUA-Leanがロボットエージェントを効率化
ロボティクス・フィジカルAI
cctest.ai

観測を減らすほど行動は改善する?PyRUA-Leanがロボットエージェントを効率化

PyRUA-Leanは、ロボットのプリミティブをPythonセル内で組み合わせ、条件判定や局所的な再試行を実行するフレームワークです。700件のシミュレーションで、同じLLM呼び出し予算のもと成功率を63.1%から71.7%へ高め、両方式が解けたタスクでは入力トークンを65%削減しました。

続きを読む
CCTest · Blog
ロボットは記憶だけでは足りない:変化する世界を進むEvolvingNav
ロボティクス・フィジカルAI
cctest.ai

ロボットは記憶だけでは足りない:変化する世界を進むEvolvingNav

ロボットが向かっている間に、記憶された物体の位置が変わることがあります。EvolvingNavは、時間付き3D記憶と確率的な信念更新を組み合わせ、変化する環境でのナビゲーションを目指します。

続きを読む