観測を減らすほど行動は改善する?PyRUA-Leanがロボットエージェントを効率化
導入
ロボットエージェントにとって、あらゆる動作の後に画像を取得し、毎回言語モデルへ判断を求めることが、必ずしも信頼性の向上につながるとは限りません。視覚言語モデルを使うロボット制御では、観測、推論、動作、再観測というループが繰り返されます。似た画像や状態情報が何度も入力されると、トークン消費だけでなく、モデル呼び出しの遅延も増えていきます。
Hugging Face Daily Papersで紹介されたPyRUA-Leanは、このやり取りの設計を見直します。エージェントは一つずつツールを呼び出すのではなく、実行可能なPythonセルを作成します。その中で複数の動作を組み合わせ、状態を確認し、必要なら局所的に再試行できます。次の再計画に必要な情報だけを返す点が特徴です。
主な仕組み
- 動作のコード化:古典的なロボットプリミティブと、学習済みの視覚言語行動(VLA)ポリシーを同じ処理フローに組み込めます。
- ローカルな条件処理:単純な状態確認や再試行を実行セル内で処理し、小さな判断のたびにLLMを呼び出す必要を減らします。
- 選択的な観測:エージェントが明示的に要求した画像や状態フィードバックだけを返します。
- 同一条件での比較:PyRUA-Leanとツール呼び出し方式は、同じGPT-6 Astraプランナーと基盤プリミティブを使って比較されています。
実験結果
評価対象はLIBERO-PRO、RoboTwin 2.0、RoboCasa365からなる700件のシミュレーションタスクです。LLM呼び出しの予算をそろえた場合、従来のベースラインの成功率は63.1%、PyRUA-Leanは71.7%でした。差は8.6ポイントで、相対的には約14%の改善に相当します。
効率面でも差が示されています。両方のエージェントが解決したタスクに限ると、PyRUA-LeanはLLM呼び出しを49%、入力トークンを65%削減しました。つまり、モデルにより多く推論させることで成功率を上げたのではなく、実行環境側に一部の制御ロジックを移し、再計画が必要な場面にモデルを集中させたと解釈できます。
意義と残された課題
この研究が示すのは、身体化AIの性能がモデルそのものだけでなく、モデルと環境をつなぐインターフェースにも左右されるという点です。複数の動作をまとめ、条件分岐と局所的な再試行を実行環境で処理すれば、コンテキストの増大や応答遅延を抑えながら、必要なときには再計画できます。
一方、今回の結果は三つのシミュレーションベンチマークに基づいています。提供された資料からは、実機、別のプランナーモデル、長時間の現実環境タスクで同じ効果が得られるかは判断できません。したがって、トークン削減をそのまま実運用の信頼性と同一視するのは早計です。それでも、すべての観測をモデルへ送るのではなく、定型的なフィードバックを実行層で処理するという設計方針は、今後のロボットエージェントにとって重要な選択肢になりそうです。
コメント
ログイン状態を確認中…
コメントを読み込み中…