Skill2Real:ロボット技能をシミュレーションから現実へ移す
ロボットをシミュレーションから実環境へ移す際の難しさは、単に動作を学習させることではない。視覚情報、接触や動力学、さらにロボットの身体構成が変わっても、学習した知識を使い続けられる必要がある。Skill2Realは、この問題をタスク方策の再学習ではなく、再利用可能な実行技能とその記憶の移行として捉える。
手法の要点
中心となるのは、ロボットを操作する共通のアプリケーション・プログラミング・インターフェース(API)である。技能はシミュレータ内部の隠れた状態に直接依存せず、公開観測とAPIの意味に基づいて表現される。これにより、環境や身体構成が変わっても、技能の境界を保ちやすくする。
学習には、提案者・検証者・統括者(Proposer–Verifier–Governor、PVG)のループを用いる。提案者は技能を生成または修正し、検証者はシミュレーションで得られる特権的な証拠を利用して、結果の成否や失敗原因を調べる。統括者は更新を採用するか、技能記憶をどのように変化させるかを判断する。つまり、試行錯誤を繰り返すだけでなく、シミュレーションの診断情報を更新の審査に組み込む設計だ。
能力は二層に分けられる。まず「小脳」が局所的な操作技能を学習し、その後、「脳」が小脳を凍結した状態で、技能をタスクの手順に組み合わせる。最終的には両方の記憶を実機へ移し、タスク方策の微調整や技能記憶の更新を行わない。
報告された結果
- GPT-5.6 SolがLIBERO-90で技能を学習し、GPT-6 Astraが凍結チェックポイントを評価した場合、LIBERO-Pro Longの成功率は2.0%から56.3%へ上昇した。Pro Long自体での訓練は行っていない。
- Robosuiteの7タスクで独立に学習した場合、平均成功率はSolで85.1%、Opus 5で89.4%だった。
- SolでLIBERO-90から学習した凍結技能は、Astraによる実行で、4つの実世界操作タスクにおいて平均78.75%の完了率を達成した。
- VerifierまたはGovernorを除くと、最終的なPro Long成功率はそれぞれ17.3ポイント、13.3ポイント低下した。
意義と残る課題
Skill2Realの意義は、sim-to-realを「タスクごとにエンドツーエンド方策を作り直す問題」から、「共通インターフェースを通じて、検査可能で組み合わせ可能な技能を移す問題」へ置き換えた点にある。APIは環境間の抽象層となり、階層構造は運動の実行とタスク構成を分離する。PVGは、実機では集めにくい診断情報をシミュレーションで活用する。
一方、結果は記載されたベンチマーク、モデル構成、4つの実機タスクの範囲で解釈する必要がある。APIの設計、観測の品質、シミュレーションと実機の差が、転移性能に影響する可能性も残る。より多様なロボット、長い操作系列、開放的なタスクで同じ効果が得られるかは今後の検証課題である。
コメント
ログイン状態を確認中…
コメントを読み込み中…