EVO-WAM、ロボットに「想像した軌跡」を検証させて学習させる
ロボットを新しいタスクに適応させるには、通常、専門家による追加デモンストレーションか、実環境での繰り返し試行が必要になる。どちらもコストが高く、長い時系列のタスクでは特に負担が大きい。論文「EVO-WAM: Evolving World Action Models through Video-Action Verification」は、世界行動モデル(WAM)が自分で生成した経験から学ぶ方法を示している。
生成結果をそのまま学習しない
WAMは、幅広い動画の事前知識を利用して、将来の映像とロボットの行動を同時に予測する。未知タスクへの適応に使える可能性がある一方、生成された経験には問題がある。映像が目標達成を示していない場合があり、映像上は成功していても、対応する行動が実際の運動と一致せず、実行時に失敗することもある。
EVO-WAMは、この2種類の問題を段階的に検査する。
- ロールアウトの強化:状態予測を学習に加え、アンカー付きのマルチフレーム文脈を利用することで、外部環境からの実行フィードバックがなくても、より完全な自己回帰ロールアウトを生成する。
- タスク完了の判定:視覚言語モデルで、生成軌跡のうち目標を達成していると判断できるプレフィックスを選ぶ。
- 動画と行動の整合性確認:逆動力学モデルを使い、映像に示された動きと対応する行動指令が一致しているかを検証する。
- 反復的な自己学習:検証を通過したプレフィックスでWAMを再学習し、更新後のモデルで新たな軌跡を生成する。
実験で確認された改善
7つの未知タスクを含むRoboTwin 2.0では、Cosmos3の平均成功率が26.9%から68.0%に上昇した。DreamZeroでは28.5%から46.4%となり、それぞれ初期値のおよそ2.5倍、1.6倍に相当する。さらに、実世界の未知の長期複合タスク3件では、Cosmos3の平均成功率が20.0%から76.7%へ改善した。
意義と残る課題
重要なのは、合成軌跡を大量に作ることだけではない。EVO-WAMは、生成データを候補経験として扱い、意味的な達成度と制御上の整合性の両方を確認してから学習に利用する。これにより、すべての候補行動を実際のロボットで試す前に、モデル内部で仮説を絞り込める。
また、見た目に自然な動画と、実行可能な行動列は同じではないことも明確にしている。今後は、より多様な環境や失敗パターン、長いタスクでも2つの検証器が安定して機能するかを確かめる必要がある。それでも、世界モデルの「想像」を自己改善の訓練資源へ変える具体的な設計として、EVO-WAMは有望な一歩だ。
コメント
ログイン状態を確認中…
コメントを読み込み中…