記事一覧へ戻る
ロボティクス・フィジカルAI

世界モデルのように考え、VLAの速度で動くロボット方策

読了目安 3 分

導入

視覚・言語・行動(VLA)モデルは、画像による観測と指示をロボットの行動へ直接変換できる。一方で、その学習目標は次に取るべき行動に偏りやすく、行動によって環境がどう変化するかを明示的には扱わない。そのため、頑健性は訓練データがどれだけ多様な状況を含むかに大きく左右される。

世界モデルは、環境の未来状態を予測することで、より物理的な理解を獲得できる。しかし、意思決定のたびに未来を展開すると数秒の計算時間が必要となり、リアルタイム制御には向きにくい。論文「Think Like a World Model, Act Like a VLA」は、この二つの役割を分離する。

手法の要点

  • 未来の生成ではなく特徴を移す。 物体、空間関係、シーンの変化に関する知識は、世界モデルの中間特徴にすでに表現されているという考え方だ。未来フレームの生成は、その表現を学習させた目的であって、配備時に残すべき機能とは限らない。
  • 特徴整合の損失を追加する。 凍結した世界モデルを訓練フレームに一度だけ適用し、出力特徴を保存する。VLA学生モデルは通常の行動学習に加え、そのキャッシュされた特徴に近づくよう学習する。
  • 訓練後に教師を削除する。 教師モデルは訓練中に常時読み込まず、特徴を合わせる投影器も訓練終了後に破棄する。最終方策は蒸留前のVLAと同じ推論経路で動く。
  • 配備時の計算量を増やさない。 論文では、一般向けRTX 5090上で32ミリ秒、1.86GBのメモリ使用量が報告されている。

結果と意義

0.8Bの学生モデルはLIBEROで97.9%を達成した。RoboCasa-GR1の人型ロボット操作では、成功率が48.2%から50.5%へ向上した。また、単腕と両腕の実機プラットフォームにも同じ学習目標が適用された。学生モデルの規模、バックボーン、整合層、教師モデルを変更しても改善が残った点は、特定の二つのネットワークに依存しない表現上の事前知識である可能性を示す。

この設計では、世界モデルがオフラインで物理的な学習信号を提供し、VLAがオンラインで高速な行動予測を担う。未来予測を制御ループから外せるため、追加パラメータやテスト時計算ではなく、表現の質による改善として評価しやすい。

ただし、提供された素材は主に概要であり、訓練コスト、タスク別の詳細、失敗例までは示していない。分布外環境や長時間操作での安定性は、完全な論文と追加の実機検証で確認する必要がある。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
RoboDawn、視覚言語モデルの推論をロボット制御へ移す
ロボティクス・フィジカルAI
cctest.ai

RoboDawn、視覚言語モデルの推論をロボット制御へ移す

RoboDawnは、平行移動・回転・グリッパー操作を離散コマンドにまとめ、エージェント型の視覚言語モデルからロボットを制御する仕組みを提案する。閉ループ制御と少数の実演により、シミュレーションと実機の双方で性能向上を示した。

続きを読む
CCTest · Blog
Grounded Action Model:3Dグラウンディングをロボット制御の基盤に
ロボティクス・フィジカルAI
cctest.ai

Grounded Action Model:3Dグラウンディングをロボット制御の基盤に

Grounded Action Model(GAM)は、物体の3D位置や形状を明示的に取り込んでロボットの行動を予測するモデルです。言語、点、ボックスによる指示を共通の物体中心表現に変換することで、対象物の移動や視覚的な環境変化に対する頑健性を高めます。

続きを読む
CCTest · Blog
明示的な軌道なしで先読みする3D拡散ポリシー
ロボティクス・フィジカルAI
cctest.ai

明示的な軌道なしで先読みする3D拡散ポリシー

短い観測履歴からインタラクションの進行方向を表す潜在表現を学習し、3D拡散ポリシーに先読み能力を加える手法が提案された。完全な軌道計画を導入せず、DP3の枠組みを維持したまま性能向上を報告している。

続きを読む