Long-WAM、ロボット制御に実用的な長期視覚記憶を導入
はじめに
ロボットが安定して作業するには、現在のカメラ画像だけでは不十分なことがあります。物体がどの方向に動いているか、作業がどの段階まで進んだか、直前の操作が環境にどんな変化を与えたかは、連続した視覚履歴から判断する必要があります。一方で、履歴を長くすると処理量が増え、アクションの遅延につながります。Long-WAMは、この記憶と応答性の両立を目指すモデル・システムフレームワークです。
重要なのは履歴の長さではなく使い方
Long-WAMは、因果的なワールド・アクションモデルのコンテキストを拡張します。まず、アクションラベルのないロボット動画や一人称動画から自己回帰型の動画予測を学習し、過去の観測から未来を推測する構造を身につけさせます。その後、ワールド・アクションモデルへ適応する際にも、過去から未来へつながる関係を保ちます。
論文の中心的な示唆は、長い履歴にアクセスできることと、それを有効に利用できることは同じではない、という点です。RoboCasa GR-1では、自己回帰型の動画事前学習を使ったモデルでコンテキストを0.0秒から19.2秒へ拡張すると、成功率が63.3%から78.7%に向上しました。一方、双方向事前学習による初期化では、履歴を増やしても全体として改善は見られませんでした。ロボット領域の自己回帰事前学習を追加すると、GR-1とLIBERO-Longでの最高性能も伸びています。
リアルタイム性を支えるシステム設計
長い履歴に加えて未来動画の潜在表現も予測するには、推論コストへの対策が必要です。Long-WAMは観測のストリーミングエンコード、非同期実行、ハードウェアごとの高速化を組み合わせています。RTX 5090では、未来動画の潜在予測を含む1つのアクションチャンクを107.4ミリ秒で処理します。DGX SparkやJetson AGX Thorでも、未来予測を省略せずに展開できる構成が示されています。
評価では、LIBERO-Long、RoboTwin 2.0、DOMINOで比較対象中の最高結果を報告しています。Unitree G1とYAMを使った実機実験では、動的かつ長時間の操作を検証しました。動的なカップ積みでは成功率95%を達成し、Pi0.5とFast-WAMは20回の試行で成功しませんでした。
意義と今後の課題
Long-WAMが示すのは、コンテキスト拡張を単なる入力長の問題として扱うべきではないということです。事前学習の目的、アクションへの適応、実行システムを一体で設計することで、過去の観測を未来の結果予測や作業進捗の把握に結びつけられます。高レベルのプランナーと組み合わせる、記憶を備えた実行器としての役割も期待されます。
ただし、現時点の結果は報告されたベンチマーク、ロボット、ハードウェアに基づくものです。未知の環境や異なるセンサー、より多様なタスクで同じ安定性を得られるか、また長期予測に伴う計算・データコストがどうなるかは、今後の検証課題です。
コメント
ログイン状態を確認中…
コメントを読み込み中…