DiVeR、VLAの検証器を重要なロボット判断に集中させる
導入
視覚・言語・行動(VLA)モデルは、複雑なロボット操作を扱うための有力な基盤になりつつある。一方で、より多くのロボットデータや大規模なモデルを用いて性能を伸ばす方法には、データ収集と学習に大きなコストが伴う。そこで注目されるのがテスト時スケーリングだ。同じ観測に対して複数の行動候補を生成し、検証器によって最も成功しそうな候補を選択する。
DiVeRが取り組むのは、検証器が軌道のどの状態を重視して学習すべきかという問題である。従来の分類型検証器は、軌道全体の成功・失敗を教師信号として使い、訪れた状態をほぼ均等に扱うことが多い。しかし、多くの状態では妥当な行動候補が互いに似ており、候補を見分けても最終結果への影響は小さい。実際に重要なのは、異なる行動がその後の結果を大きく分ける、少数の状態である。
手法の要点
- 行動の分散から重要度を推定:複数の候補行動を表現空間で比較し、分散が大きい状態を、選択の影響が大きい可能性のある状態として扱う。
- 検証器の学習を再重み付け:軌道上のすべての状態に同じ学習上の重みを与えるのではなく、候補行動の差が大きい位置を重点的に学習する。
- 追加の段階別ラベルを不要にする:各ステップに成功・失敗ラベルを付けたり、追加の環境試行を行ったりせず、既にサンプリングされた候補行動から信号を得る。
- 推論時の負担を抑える:行動表現を利用して重要度を推定するため、論文では検証器の推論オーバーヘッドが無視できる程度だとしている。
実験と意義
DiVeRはLIBERO、RoboCasa、およびFranka Research 3を用いた実機実験で評価された。論文概要によれば、複数の設定において、検証器による候補行動の選択を改善し、タスク成功率を一貫して高めた。
この研究の意義は、テスト時スケーリングを単純な候補数の増加から、候補の違いが本当に重要な場所を見極める仕組みへと広げた点にある。長期の操作タスクでは、検証器が軌道全体を均等に評価するよりも、接触、把持、障害物回避、行動の切り替えなど、後続結果を変えうる状態に判断能力を集中させる方が合理的だろう。
もっとも、行動表現の分散はあくまで重要度の代理指標であり、将来のタスク価値を直接測るものではない。表現空間の差が実際の実行結果とどの程度対応するか、また候補行動の質が十分かどうかは依然として重要である。それでも、追加のロボットデータ収集を必要とせず、既存のVLA推論パイプラインに組み込みやすい改善策を示した点は実用的だ。
コメント
ログイン状態を確認中…
コメントを読み込み中…