記事一覧へ戻る
ロボティクス・フィジカルAI

Zero-WAM、人間の動画を見て未学習タスクへ挑むロボット

読了目安 3 分

導入

ロボット学習における難題は、既知の動作を正確に繰り返すことだけではありません。訓練時に一度も見ていない作業を、実行時に理解して動かせるかどうかが、オープンエンドな環境での実用性を左右します。大規模言語モデルでは、新しい依頼を入力の文脈に置くことで、パラメータを更新せずに対応できる場合があります。Zero-WAMは、このインコンテキスト学習の発想をロボット操作へ持ち込み、人間の操作動画をタスクの指定として使います。

手法のポイント

Zero-WAMは因果的な動画・アクションモデルです。実行時には、人間が作業する動画を文脈プロンプトとして受け取り、その動画からロボットの将来の動作を予測します。目的は、人間の軌跡をそのまま再生することではありません。動画に含まれる対象物の関係、操作の順序、接触の仕方、作業の進行を読み取り、訓練データにないタスクへ転用することを目指します。

この研究が注目するもう一つの問題は、対応付けられた人間・ロボットデータの不足です。ロボット軌跡だけを大量に集めても、人間による意味的に対応する実演が得られるとは限りません。そこで研究チームは、タスクからサンプリングしたロボット軌跡を、意味的に対応する人間動画へ変換する自動パイプラインを提案しました。こうして作られたHumanGenは、8600タスクにわたる7.42万組の人間・ロボットのインコンテキスト学習ペアを含みます。

ショートカットを抑える学習

動画を入力できるだけでは、モデルが動画を本当に参照するとは限りません。訓練中に見たタスクとの相関を利用し、プロンプトを無視する可能性があるためです。Zero-WAMでは、in-context future chunk prediction(IFP)という学習目標を導入し、既知タスクに依存した近道を抑えます。これにより、未来の動作チャンクを予測する際、動画からタスク情報を取り出すことを促します。

結果と意味

RoboTwin 2.0シミュレーションの未学習7タスクでは、Zero-WAMの平均成功率は47.0%でした。提供された資料によれば、これは最も強い動画・アクションベースラインに対する29.5ポイントの絶対改善です。論文は実世界での評価も報告していますが、手元の抜粋にはタスク数や成功率の詳細がないため、実環境での性能をさらに断定することはできません。

この研究の意義は、ロボットのタスク指定を言語だけに限定しない点にあります。動画は、幾何学的な関係、時間的な順序、接触、途中状態を一度に示せます。HumanGenはデータ不足に、IFPは訓練タスクの記憶という問題に対応しており、動画を使った汎化にはモデル構造だけでなく、データ設計と学習目標も重要だと示しています。

一方、人間とロボットでは身体構造、視点、制御空間、物理的能力が異なります。長い作業手順や予測しにくい環境で同じ効果が得られるかは、今後の検証課題です。それでも、再学習ではなく「見て理解して動く」ことを、ロボットの適応インターフェースにする方向性は明確です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
TacForcing、実行中の触覚フィードバックでロボット動作を更新
ロボティクス・フィジカルAI
cctest.ai

TacForcing、実行中の触覚フィードバックでロボット動作を更新

TacForcingは、ロボットが動作を実行している最中に得た触覚情報を、視覚言語行動モデルへ取り込むストリーミング動作生成フレームワークです。独立した高周波リアクティブ制御器を追加せず、未実行の動作を逐次的に修正します。

続きを読む
CCTest · Blog
Claudeが物理世界へ:Anthropic、MHSハードウェア標準を発表
ロボティクス・フィジカルAI
cctest.ai

Claudeが物理世界へ:Anthropic、MHSハードウェア標準を発表

Anthropicは、AIエージェントがロボットアームや顕微鏡、実験機器を発見・操作するための「Model Hardware Standard(MHS)」研究プレビューを公開した。Claudeに固定された身体を与えるのではなく、接続された機器を必要に応じて使う発想だ。

続きを読む
CCTest · Blog
StreamPI、単一フレームVLAモデルにストリーミング時系列推論を追加
ロボティクス・フィジカルAI
cctest.ai

StreamPI、単一フレームVLAモデルにストリーミング時系列推論を追加

StreamPIは、追加パラメータなしで単一フレーム型の視覚・言語・行動モデルに時系列推論を導入する。指示を軸にした注意機構とランダム間隔学習により、ロボットが過去の観測を活用し、非同期入力にも対応できるようにする。

続きを読む