世界モデルのように考え、VLAの速度で動くロボット方策
導入
視覚・言語・行動(VLA)モデルは、画像による観測と指示をロボットの行動へ直接変換できる。一方で、その学習目標は次に取るべき行動に偏りやすく、行動によって環境がどう変化するかを明示的には扱わない。そのため、頑健性は訓練データがどれだけ多様な状況を含むかに大きく左右される。
世界モデルは、環境の未来状態を予測することで、より物理的な理解を獲得できる。しかし、意思決定のたびに未来を展開すると数秒の計算時間が必要となり、リアルタイム制御には向きにくい。論文「Think Like a World Model, Act Like a VLA」は、この二つの役割を分離する。
手法の要点
- 未来の生成ではなく特徴を移す。 物体、空間関係、シーンの変化に関する知識は、世界モデルの中間特徴にすでに表現されているという考え方だ。未来フレームの生成は、その表現を学習させた目的であって、配備時に残すべき機能とは限らない。
- 特徴整合の損失を追加する。 凍結した世界モデルを訓練フレームに一度だけ適用し、出力特徴を保存する。VLA学生モデルは通常の行動学習に加え、そのキャッシュされた特徴に近づくよう学習する。
- 訓練後に教師を削除する。 教師モデルは訓練中に常時読み込まず、特徴を合わせる投影器も訓練終了後に破棄する。最終方策は蒸留前のVLAと同じ推論経路で動く。
- 配備時の計算量を増やさない。 論文では、一般向けRTX 5090上で32ミリ秒、1.86GBのメモリ使用量が報告されている。
結果と意義
0.8Bの学生モデルはLIBEROで97.9%を達成した。RoboCasa-GR1の人型ロボット操作では、成功率が48.2%から50.5%へ向上した。また、単腕と両腕の実機プラットフォームにも同じ学習目標が適用された。学生モデルの規模、バックボーン、整合層、教師モデルを変更しても改善が残った点は、特定の二つのネットワークに依存しない表現上の事前知識である可能性を示す。
この設計では、世界モデルがオフラインで物理的な学習信号を提供し、VLAがオンラインで高速な行動予測を担う。未来予測を制御ループから外せるため、追加パラメータやテスト時計算ではなく、表現の質による改善として評価しやすい。
ただし、提供された素材は主に概要であり、訓練コスト、タスク別の詳細、失敗例までは示していない。分布外環境や長時間操作での安定性は、完全な論文と追加の実機検証で確認する必要がある。
コメント
ログイン状態を確認中…
コメントを読み込み中…