RoboFoundry、実行経験を進化するロボットシステムへ変える
導入
ロボットが一度タスクを完了できても、同じ種類の課題を次回から安定して処理できるとは限らない。従来の具身エージェント研究では、メモリ、コンテキスト管理、スキル、アクションインターフェースなどを個別に改善することが多かった。基盤モデルが判断し、周辺モジュールが情報提供や動作実行を担う構成である。
しかし、失敗経験が検証可能なシステム変更へ変換されなければ、ロボットは次の試行でも同じ問題に直面する。RoboFoundryはこの課題に対し、「Self-Evolving System-as-Policy」という考え方を提示する。方策をモデルのパラメータや単一のプロンプトだけでなく、コンテキスト、記憶、スキル構造、失敗からの回復方法まで含むシステム全体として扱う。
主なポイント
- 実行履歴から能力不足を診断。 タスクの実行過程を分析し、意思決定や記憶管理の問題を特定する。経験は未整理のログとして残すのではなく、タスクに対応した更新へ変換される。
- 二つの領域を進化させる。 コンテキストシステムは、現在利用する情報とファイルシステム上の永続メモリを管理する。階層型スキルシステムは、原子スキル、再利用可能な組み合わせ、失敗条件に応じた回復手順を整理する。
- 検証後に一般化。 新しい更新はまず対象タスクで検証され、繰り返し有効性が確認されたものだけが汎用システムへ昇格する。単発の誤った経験が長期的な動作に残るリスクを抑える設計だ。
- 判断と実行を分離。 共有セマンティックインターフェースによって、ロボットに依存しない判断と、機体ごとの実行を切り分ける。これにより、異なるロボットへの能力移転を狙う。
報告された結果
EmbodiedBenchでは、論文が最先端の性能とする結果を示し、GPT-5.5に対して27.8%の改善を報告している。Qwen3.7-Plusは70.3%に達し、GPT-5.5の72.7%に近づいた。特定の基盤モデルだけに依存しない改善である可能性を示す結果だ。
長期記憶を評価するRoboMemArenaでは、外部の基盤モデルを利用する手法も含め、すべてのベースラインを少なくとも39.0%上回った。LIBERO-PROでは、記載された各種の摂動条件でCap-Agent0に対して243.8%から679.7%の改善が報告されている。実環境では、ゼロショット転移とオンライン進化の事例も示された。
意義と今後の課題
RoboFoundryの意義は、自己改善をモデルの再学習だけの問題として扱わない点にある。失敗から、記憶の構造、スキルの階層、将来の回復手順そのものを変更できれば、長い手順を要するタスクで経験を蓄積しやすくなる。
一方、提示された素材だけでは、更新アルゴリズムの詳細、検証コスト、有害な更新の割合、ハードウェア間の比較までは確認できない。より開放的で安全性が重要な環境でも安定して進化できるかは、追加検証が必要である。それでも本研究は、具身知能の向上が、より大きなモデルだけでなく、経験を選別・検証・継承するシステム設計からも生まれ得ることを示している。
コメント
ログイン状態を確認中…
コメントを読み込み中…