記事一覧へ戻る
ロボティクス・フィジカルAI

汎用エージェントがロボットを直接操作する「Agent as Policy」

読了目安 3 分

導入

実世界でロボットを動かすには、対象を認識するだけでは不十分です。ロボットは認識結果を連続した動作に変換し、接触や位置ずれによって計画どおりに進まなかった場合には、次の行動を修正しなければなりません。従来の操作システムでは、タスクや環境ごとにデータを集め、専用ポリシーを訓練することが一般的でした。

研究チームが提案する Agent as Policy(AGP) は、汎用コーディングエージェントを物理ロボットのインターフェースに直接接続するアプローチです。エージェントはカメラなどの視覚情報を解釈し、実行可能なプログラムを書き、モーション指令を発行します。その後、実際の動作結果を確認し、必要に応じてコードや後続動作を変更します。

主なポイント

  • 計画と実行を一体化:エージェントは単に高レベルの手順を出力するだけでなく、推論をプログラムとロボット命令へ変換します。
  • 実行時のフィードバック:物体の位置や姿勢、接触の結果が予想と異なる場合、固定軌道をそのまま再生せず、次の行動を調整できます。
  • 専用訓練に依存しない設計:素材では、モデルの重みを固定し、タスク別・環境別の訓練を行わない点が強調されています。
  • 多様な操作を評価:人間の動画からの組み立て、目標画像に基づく積み木、サイコロの向き変更、狙いを定めた投擲、両腕によるタオル折りを扱っています。精密操作、動的動作、変形物体が含まれます。
  • 手順の再利用:保存したプログラムや操作手順を繰り返し試行で利用すると、実行時間を短縮できます。

結果と限界

積み木の3つの構成における成功率は、100%、100%、80%でした。補足情報では、組み立て、積み木、サイコロの各評価構成について、10回中少なくとも8回の成功が得られたとされています。これは、汎用エージェントが複数の実ロボット操作で実行可能な振る舞いを生成できることを示す結果です。

一方で、これだけであらゆる環境に通用するロボット能力が確立したとは言えません。提供された素材には、詳細なハードウェア構成、失敗の分類、タスク規模、専用ポリシーとの体系的な比較が含まれていません。したがって、今回の成果は一般化の証明というより、実現可能性を示すものと見るべきです。

意義と今後

AGPは、ロボットポリシーを固定パラメータのモデルだけでなく、観察、プログラム生成、ツール呼び出し、修正を繰り返す実行時プロセスとして捉え直します。新しいタスクごとに別のポリシーを訓練する負担を減らし、動画、目標画像、自然言語による指示を共通の入口として利用できる可能性があります。

ただし、コードの誤りや視覚的な誤認識は、そのまま物理的な動作につながります。実用化には、動作の検証、安全制約、長時間運転での評価、失敗からの回復機構が不可欠です。AGPは汎用ロボット操作を完成させたというより、汎用エージェントを身体世界へ接続する一つの設計方向を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
PhysBrain 1.5、認識・行動生成・未来予測を一つのモデルに統合
ロボティクス・フィジカルAI
cctest.ai

PhysBrain 1.5、認識・行動生成・未来予測を一つのモデルに統合

PhysBrain 1.5は、視覚言語モデルを物理環境の理解、エンドエフェクタの動作生成、未来状態の予測まで扱う具身基盤モデルへ拡張する試みです。論文によれば、8Bモデルは28件の具身理解ベンチマークで平均72.5点を達成しました。

続きを読む
CCTest · Blog
MobileVLA-R1 2.0、強化学習でロボットの推論と行動を接続
ロボティクス・フィジカルAI
cctest.ai

MobileVLA-R1 2.0、強化学習でロボットの推論と行動を接続

MobileVLA-R1 2.0は、構造化された身体的推論、強化学習、推論条件付きアクションデコーダを組み合わせ、言語理解からロボット実行までの隔たりに取り組む。ナビゲーション、四脚ロボット、人型移動マニピュレーションで評価された。

続きを読む
CCTest · Blog
ロボットの視覚的な近道を断つ、LITによる行動モデルの汎化
ロボティクス・フィジカルAI
cctest.ai

ロボットの視覚的な近道を断つ、LITによる行動モデルの汎化

ロボット基盤モデルは、見慣れた環境では高い性能を示しても、行動と偶然結び付いた視覚的手掛かりに依存することがあります。Latent Interface Training(LIT)は、空間目標に基づく行動事前分布と姿勢監督付き潜在インターフェースによって、視覚分布の変化に対する頑健性を高めます。

続きを読む