記事一覧へ戻る
世界モデル

EVO-WAM、ロボットに「想像した軌跡」を検証させて学習させる

読了目安 3 分

ロボットを新しいタスクに適応させるには、通常、専門家による追加デモンストレーションか、実環境での繰り返し試行が必要になる。どちらもコストが高く、長い時系列のタスクでは特に負担が大きい。論文「EVO-WAM: Evolving World Action Models through Video-Action Verification」は、世界行動モデル(WAM)が自分で生成した経験から学ぶ方法を示している。

生成結果をそのまま学習しない

WAMは、幅広い動画の事前知識を利用して、将来の映像とロボットの行動を同時に予測する。未知タスクへの適応に使える可能性がある一方、生成された経験には問題がある。映像が目標達成を示していない場合があり、映像上は成功していても、対応する行動が実際の運動と一致せず、実行時に失敗することもある。

EVO-WAMは、この2種類の問題を段階的に検査する。

  • ロールアウトの強化:状態予測を学習に加え、アンカー付きのマルチフレーム文脈を利用することで、外部環境からの実行フィードバックがなくても、より完全な自己回帰ロールアウトを生成する。
  • タスク完了の判定:視覚言語モデルで、生成軌跡のうち目標を達成していると判断できるプレフィックスを選ぶ。
  • 動画と行動の整合性確認:逆動力学モデルを使い、映像に示された動きと対応する行動指令が一致しているかを検証する。
  • 反復的な自己学習:検証を通過したプレフィックスでWAMを再学習し、更新後のモデルで新たな軌跡を生成する。

実験で確認された改善

7つの未知タスクを含むRoboTwin 2.0では、Cosmos3の平均成功率が26.9%から68.0%に上昇した。DreamZeroでは28.5%から46.4%となり、それぞれ初期値のおよそ2.5倍、1.6倍に相当する。さらに、実世界の未知の長期複合タスク3件では、Cosmos3の平均成功率が20.0%から76.7%へ改善した。

意義と残る課題

重要なのは、合成軌跡を大量に作ることだけではない。EVO-WAMは、生成データを候補経験として扱い、意味的な達成度と制御上の整合性の両方を確認してから学習に利用する。これにより、すべての候補行動を実際のロボットで試す前に、モデル内部で仮説を絞り込める。

また、見た目に自然な動画と、実行可能な行動列は同じではないことも明確にしている。今後は、より多様な環境や失敗パターン、長いタスクでも2つの検証器が安定して機能するかを確かめる必要がある。それでも、世界モデルの「想像」を自己改善の訓練資源へ変える具体的な設計として、EVO-WAMは有望な一歩だ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Physis-Lang:進化する物理言語で動画世界モデルを改善
世界モデル
cctest.ai
世界モデル

Physis-Lang:進化する物理言語で動画世界モデルを改善

NVIDIAの研究チームは、物体や因果関係、相互作用、時間変化を記述する物理言語を、動画の収集・学習・生成に共通する表現として扱うPhysis-Langを提案しました。原子レベルの断言評価と言語誘導検索により、物理的に妥当な動画生成を目指します。

続きを読む
CCTest · Blog
世界行動モデルの汎化を支えるのは「未来の完全生成」ではない
世界モデル
cctest.ai
世界モデル

世界行動モデルの汎化を支えるのは「未来の完全生成」ではない

新しい実証研究は、世界行動モデルが推論時に未来動画を最後まで生成しなくても、汎化性能の利点を維持できる可能性を示した。重要なのは、行動を決める前に未来表現を準備することだという。

続きを読む