World Action Agent:VLMにロボット動作を“リハーサル”させる
導入
視覚言語モデル(VLM)は、豊富な知識と空間推論能力を持つ。しかし、その能力を実世界のロボット操作へ安定して変換することは依然として難しい。従来のシステムでは、VLMに制約を予測させたり、制御プログラムを書かせたり、シーンの固定画像を見せて行動を選ばせたりすることが多い。そこでは「何が見えるか」と「その世界でどう行動するか」の間に、別の制御インターフェースが必要になる。
World Action Agent(WAA)は、このインターフェースを行動可能な視覚ワークスペースとして設計する。VLMに操作手順全体を一度で出力させるのではなく、複数のエージェントと基本ツールを使わせ、観察、提案、修正、実行を一つの流れにまとめる。
3つの中核機能
- 接触視点:シーンの幾何情報から、現在の操作地点を中心とする視点を自動選択する。つかむ、押す、触れるといった動作に対して、固定された全体画像だけでなく、接触に関係する局所情報を提示する。
- 動作リハーサル:各動作を、実行前に編集できる提案として扱う。エージェント自身が修正できるほか、Imagination Agentに結果を予測させ、計画から得られるフィードバックを使って提案を見直せる。
- 視野内補正:低レベルの実行後に位置ずれが残った場合、エラーを観察した同じ視点から補正する。観察、リハーサル、実行が別々の段階で断絶しない。
WAAは実行だけでなく、具身的な手続き知識の蓄積にも使われる。専門家の動画や人間による教示からマルチモーダルなスキルを発展させ、証拠に基づいてレビューしたうえでSkill Agentから呼び出す。また、ワークスペースで収集した相互作用の軌跡を利用し、同じハーネスを操作する小型VLMを訓練できる。
結果が示すこと
LIBERO-Proでは、LIBERO-90だけから発展させたスキルを使ったWAAが、平均成功率75.6%を達成した。論文では、端末間の視覚言語アクションモデル、コードを方策とするエージェント、同じバックボーンを使う視覚ハーネスのベースラインを上回ったと報告している。さらに、これらのスキルは追加学習なしでrobosuiteでも有効だった。
ハーネスの軌跡でQwen3.5-9Bを微調整すると、ドメイン外の成功率は1.7%から43.3%へ上昇した。この結果は、ワークスペースが単なる実行ラッパーではなく、シーンの確認、動作の形成、フィードバックへの対応を学ぶための構造化されたデータ形式にもなり得ることを示す。
意義と残る課題
WAAのポイントは、VLMの周囲にツールを追加したことだけではない。ロボット操作を、確認可能で修正可能な判断の連続として再構成した点にある。意味理解を、プレビュー、計画フィードバック、視覚的補正によって低レベル実行へ接続するため、長い手順の初期ミスが後続操作へ波及する影響を抑えられる可能性がある。
一方、今回の結果だけで、家庭や産業現場のあらゆる状況に対する頑健性が証明されたわけではない。接触視点の選択、計画フィードバックの品質、スキルレビューのコスト、複雑な操作における安全境界は、今後さらに検証する必要がある。
それでもWAAは、ロボットに単に世界を見せるのではなく、動作を試し、見直せる世界を与えるという方向性を示している。これは、汎用VLMを具身知能へ接続するための、明確なシステム設計の一例である。
コメント
ログイン状態を確認中…
コメントを読み込み中…