RoboFollowが暴く、具現化エージェントの指示追従の幻影
導入
ロボット研究では、タスク成功率が性能を表す代表的な指標として使われます。しかし、ロボットが動作を完了したからといって、与えられた指示を理解したとは限りません。画面内に対象物が1つしかなく、実行可能な目標や動作も1通りしかないなら、モデルは言語を無視し、場面を認識して既定の動作を出すだけでも成功できます。
RoboFollowは、この問題を指示追従の幻影と呼びます。その背景にあるのが「低シーンエントロピー」です。視覚情報からほぼ一意にタスクが決まる場面では、言語が意思決定に追加する情報は少なくなります。
言語を不可欠にする設計
RoboFollowは、指示文を長くするのではなく、同じ視覚的な場面に複数のタスク分岐を持たせます。指示に応じて別の物体を選ぶ、特定の空間関係を判断する、軌道の制約に従う、異なる論理分岐を選択するといった、運動学的に異なる行動が必要になります。つまり、視覚だけでは正解を決められず、言語と場面状態を結び付けなければなりません。
ベンチマークはRoboTwinを基盤に構築され、4種類のシーンファミリー、専門家によるデモンストレーション、評価プロトコル、コードとデータセットを含みます。単に最終動作が成功したかではなく、指示が変わったときに行動も適切に変わるかを調べる設計です。
段階的な診断方法
- 高シーンエントロピー:同じ場面設定に複数の有効なタスクを配置します。
- L0-L3プロトコル:視覚配置と意味を段階的に変化させ、空間関係、属性、軌道制約、論理条件を検証します。
- IntentとExecutionの分離:正しいタスク意図を選んだか、実際の操作を完了できたかを別々に測定します。
- 交絡の制御:対象物を簡略化し、動作を学習済みの範囲に限定して、純粋な運動制御の難しさを抑えます。
この分解は重要です。失敗の原因は、指示の誤解、対象物の選択ミス、正しい計画の不完全な実行など複数あり得ます。単一の成功率では、これらを区別できません。
評価が示すこと
研究チームは9種類のVLAおよびWAMポリシーを評価しました。L0で良好な結果を示したポリシーでも、報告されたファインチューニング設定では、L1-L3へ安定して転移するとは限りませんでした。より強いVLMバックボーン、質問応答との共同学習、LangForce、Classifier-Free Guidanceなどの対策も、この差を埋められませんでした。
これは、既存の全ロボットが言語を無視しているという意味ではありません。むしろ、従来のベンチマークだけではその可能性を排除できないことを示しています。視覚認識や動作模倣に長けたシステムでも、複数の妥当な行動から言語に合うものを選ぶ場面では脆弱かもしれません。
意義と影響
RoboFollowは、指示追従を単なる制御問題ではなく、まずタスク選択の問題として捉え直します。今後のデータセットには、同じ場面に対する反実仮想的な指示や、複数タスクの組み合わせが必要になるでしょう。評価でも、実行結果だけでなく意図選択を明示的に報告することが求められます。
言語が必要になる状況を作らない限り、高いスコアから言語理解を結論することはできません。RoboFollowは、この見落とされがちな弱点を診断するための、より厳しい評価の視点を提供しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…