ProWAM、段階的な視覚サブゴールでロボットの長期制御を支援
ロボットが物体をつかみ、指定された場所へ運ぶには、次の動作を選ぶだけでは不十分である。最終状態に到達するまでに、どのような中間状態を経るべきかを判断しなければならない。世界行動モデル(World Action Models、WAMs)は、初期観測と指示から、将来の視覚変化と行動を同時に予測することで、この課題に取り組む。しかし、タスクの時間幅が長くなると、未来の動画を高密度に生成する方式は計算負荷が高く、予測誤差も積み重なりやすい。
動画全体ではなく視覚的な道標を予測
論文が提案するProWAM(Progressive World Action Model)は、未来をフレーム単位の動画として想像する代わりに、実行順に並んだ疎な視覚サブゴールを予測する。これらは、タスクの進行を示す視覚的な道標に相当する。モデルはまず到達すべきいくつかの中間状態を設定し、それらを手がかりに各段階の行動を生成する。
この設計は、将来のフレームを1枚だけ予測する方式の弱点にも対応する。最終状態は成功の見た目を示せても、そこへ至る手順を十分に表現できない。順序付けられたサブゴールなら、現在の観測と最終指示の間に段階的な経路を置き、行動ポリシーを中間状態に結び付けられる。
主な仕組み
- 行動とサブゴールの同時予測:ロボットが何をするかと、次に何を見るべきかを一体として扱う。
- 疎な未来表現:密な動画ではなく、タスクに重要な視覚状態だけを保持し、長期予測のコストを抑える。
- 特徴のキャッシュ:動画バックボーンを1回だけ順伝播させ、サブゴールの特徴を保存する。再計画では、完全な動画生成を繰り返さず、軽量な行動デノイジングを行う。
- 行動ラベルのない動画の活用:サブゴール予測は大規模なアクションフリー動画から学習でき、複雑な視覚計画を動画バックボーン側に分担させられる。
評価結果と意義
報告された評価では、ProWAMはLIBERO-Plusで85.8%、ランダム化RoboTwinで75.7%の成功率を達成した。RoboCasa365では全体で48.1%、難易度の高いComposite-Unseen分割で18.2%となった。また、最も強いベースラインに対して最大35.9%の相対的な改善が報告されている。これらは、疎な視覚ガイダンスが計算効率だけでなく、訓練分布外の制御にも寄与する可能性を示す。
一方、今回の素材には、詳細なアブレーション、実機構成、実ロボットでの運用結果は含まれていない。そのため、カメラノイズ、動作誤差、推論遅延、安全性といった現実環境の条件でどの程度安定するかは、論文全文や追加実験を確認する必要がある。提示された数値は、実運用への完全な検証というより、提案されたモデリング方針を支持する結果として捉えるべきだろう。
ProWAMの重要性は、世界モデルが必ずしも未来の全フレームを生成する必要はないと示した点にある。意味のある視覚状態を少数だけ並べることで、タスクの進捗を伝えながら、反復的な動画生成を避けられる可能性がある。この考え方が実環境へ移転すれば、具身AIにおける計画品質、推論コスト、長期汎化のバランス改善につながりうる。
コメント
ログイン状態を確認中…
コメントを読み込み中…