記事一覧へ戻る
ロボティクス・フィジカルAI

GPT-Policy:文脈から学習する適応型ロボット

読了目安 3 分

導入

未知の環境で動くロボットに必要なのは、物体を認識して動作を生成する能力だけではない。実演や実行結果から手がかりを得て、タスク開始後に方針を調整する能力も重要になる。従来のロボットポリシーは、大規模なデータセットやタスクごとの学習に依存することが多い。しかし、現実に登場する物体の状態、配置、環境、作業の組み合わせを有限の実演だけで網羅することは難しい。論文「In-Context Robot Learning with VLM Agents」は、視覚言語モデルの文脈学習をロボット適応に利用するGPT-Policyを提案する。

仕組み

GPT-Policyは主に三つの要素で構成される。

  • 文脈コンパイラ:実演や相互作用の履歴から、タスクに関係する視覚状態の変化を抽出し、モデルに渡す文脈を整理する。
  • 視覚言語モデルエージェント:現在の観測と文脈を読み取り、ロボットやツールが取るべき動作を提案する。
  • 制約付きコントローラ:提案された動作が実行可能かを検証し、ロボットを動かしたうえで結果をエージェントに返す。

重要なのは、VLMに低レベル制御のすべてを任せない点である。モデルは実演とフィードバックを使って次の操作を推論し、コントローラはロボットの制約に照らして動作を確認する。この分業によって、視覚・言語レベルの推論と物理的な実行を分離する。勾配更新や新しいタスク専用パラメータの恒久的な変更を必要としないため、訓練後の配備時適応に近い設計といえる。

実験から分かること

研究では、タスク成功、効率、モデル間の比較、文脈を制限するアブレーションなどを評価している。実ロボット試験では、ロボットの動作ラベルが付いていない人間の動画でも、タスク達成の改善が見られた。物体の状態変化、操作の順序、実行後の結果が、直接的なロボット命令ではなくても有用な情報になり得ることを示している。

一方で、接触を伴う操作では、人間の実演をロボット動作へ対応付ける難しさが表面化する。人間とロボットでは身体構造や可動範囲が異なるため、動画上は自然な動作でも、ロボットが安全かつ正確に再現できるとは限らない。ロボットの動作と対応した参照情報を加えると、特に接触に敏感なタスクで追加の改善が得られた。

意義と限界

GPT-Policyは、完全なエンドツーエンド学習とは異なる道筋を示す。VLMを汎用的な推論エージェントとして使い、別の制御モジュールがその提案を物理的に実行可能な動作へ制約する。これにより、新しいタスクのたびに専用データを集め、ポリシーを再学習する負担を減らせる可能性がある。また、動画実演、相互作用フィードバック、ロボット制御を接続する実験的な基盤にもなる。

ただし、汎用ロボット学習が解決されたわけではない。実演の理解、ロボット固有の能力への接地、接触ダイナミクス、文脈の圧縮、実行誤差の蓄積などは依然として課題である。GPT-Policyは、VLMを適応型のロボットポリシーとして利用できるかを検証する一歩であり、同時に信頼性の高い配備に必要な条件を明確にした研究だといえる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
小型AIモデルが戦場のドローンに自律性を与える
ロボティクス・フィジカルAI
cctest.ai

小型AIモデルが戦場のドローンに自律性を与える

NATO関連プログラムに参加するScaleout Systemsは、軽量な画像認識モデルをドローンや前線の計算機に実装し、中央サーバーとの常時接続なしで目標を識別できる仕組みを開発している。ALMA計画では、自律的な目標発見から攻撃任務までのデモも行われた。

続きを読む
CCTest · Blog
AgilityのDigit 5、人間を避けるため停止やしゃがみ動作に対応
ロボティクス・フィジカルAI
cctest.ai

AgilityのDigit 5、人間を避けるため停止やしゃがみ動作に対応

Agility Roboticsは、人間と同じ作業空間で動けるよう安全機能を強化した人型ロボット「Digit 5」を発表した。人を検知すると、回避、停止、しゃがみ動作などを選択する。

続きを読む
CCTest · Blog
PhysBrain 1.5、認識・行動生成・未来予測を一つのモデルに統合
ロボティクス・フィジカルAI
cctest.ai

PhysBrain 1.5、認識・行動生成・未来予測を一つのモデルに統合

PhysBrain 1.5は、視覚言語モデルを物理環境の理解、エンドエフェクタの動作生成、未来状態の予測まで扱う具身基盤モデルへ拡張する試みです。論文によれば、8Bモデルは28件の具身理解ベンチマークで平均72.5点を達成しました。

続きを読む