記事一覧へ戻る
ロボティクス・フィジカルAI

Xiaomi-Robotics-1、10万時間超の実世界軌跡でロボットVLAをスケール

読了目安 3 分

導入

ロボット学習の難しさは、データの量と多様性にある。言語モデルや視覚モデルは大規模なウェブデータから学べるが、ロボットの操作データは物理世界で収集する必要があり、時間もコストもかかる。Xiaomi-Robotics-1 は、この制約に対して「実世界の操作軌跡を大規模に集めれば、ロボット方策もスケールするのか」という問いを正面から扱っている。

このモデルは、視覚・言語・行動を結び付ける VLA 基盤モデルとして設計されている。事前学習には、UMI デバイスで収集した10万時間超の実世界操作軌跡を利用し、家庭、商業施設、工業現場、屋外を含む1700以上のシナリオをカバーする。その後、実ロボットの身体性と人間が使う自然な命令文に合わせる後学習を行う。

重要なポイント

  • 実世界データの規模が大きい:特定のロボットだけに依存せず、embodiment-free な UMI 操作軌跡を用いることで、より広い物体、環境、操作パターンから学習できる。
  • 自動注釈で言語条件を作る:10万時間以上の軌跡を人手で説明するのは現実的ではない。そこで長い軌跡を短いクリップに分割し、視覚言語モデルでグリッパーや物体の変化を記述する。
  • 二段階の学習設計:事前学習では状態変化の説明に基づいて行動を生成する能力を獲得する。後学習では、クロスエンボディメントのロボットデータと、実家庭で収集された7200時間超の社内実ロボットデータを使って整合させる。
  • スケーリング効果が実機にも移る:データ量またはモデルサイズを増やすと、行動予測誤差が一貫して下がると報告されている。さらに、強い事前学習モデルほど、後学習後の実ロボット性能も高くなる。
  • 少量データで新タスクに適応:電話機の梱包、プリンター補充、洗濯物の投入、箱詰めの4つの実世界タスクで、平均10時間未満のデモデータにより全体成功率75%を達成した。同条件の π0.5 は40%とされる。平均40時間未満に増やすと成功率は85%に達する。
  • シミュレーションでも高い結果:RoboCasa で74.5%、RoboCasa365 で57.4%、VLABench で59.1%、RoboDojo で13.93%の平均成功率を報告し、素材では4ベンチマークすべてで最高の報告性能とされている。

意義と影響

Xiaomi-Robotics-1 の意義は、単なる新しいロボット方策の提示にとどまらない。大規模な実世界操作データを、言語で条件付けられた学習サンプルへ変換することで、ロボット基盤モデルの土台にできることを示した点にある。

もちろん、これで汎用家庭ロボットが完成したわけではない。実環境では安全性、長期計画、失敗からの回復、ハードウェア制約、評価と現場の差など多くの課題が残る。今回示されたのは、あくまで強いスケーリング傾向と複数タスクでの有望な結果である。

それでも、この研究はロボット分野の方向性を示している。今後の進歩は、より器用なハードウェアだけでなく、大規模に集められ、自動的に注釈され、異なる身体へ移せる実世界データによって加速する可能性がある。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Qwen-Drive-1.0:視覚言語モデルを自動運転へ拡張する試み
ロボティクス・フィジカルAI
cctest.ai

Qwen-Drive-1.0:視覚言語モデルを自動運転へ拡張する試み

Qwen-Drive-1.0は、事前学習済みの視覚言語モデルを土台に、3D認識、視覚質問応答、運動計画を一つの枠組みに統合する初期的な試みです。BEV認識ヘッドと計画エキスパートによって、共有表現を検査可能なシーン構造と将来軌道へ接続します。

続きを読む
CCTest · Blog
Nori Robotics、1,688ドルの両腕移動ロボットを開発者向けに投入
ロボティクス・フィジカルAI
cctest.ai

Nori Robotics、1,688ドルの両腕移動ロボットを開発者向けに投入

Nori Roboticsは、ロボット開発者と研究者を対象にした1,688ドルの両腕移動ロボットを発表した。高価な脚式機構やオンボード計算を避け、複数台を使った実験と修理のしやすさを重視する設計だ。

続きを読む
CCTest · Blog
NavMCP、基盤モデルの協調でロボットの長期ナビゲーションを前進
ロボティクス・フィジカルAI
cctest.ai

NavMCP、基盤モデルの協調でロボットの長期ナビゲーションを前進

NavMCPは、視覚言語モデルのタスク推論とナビゲーション基盤モデルの閉ループ実行を組み合わせる。複数回の探索で証拠を蓄積し、長期的な物理世界のタスクに対応する仕組みだ。

続きを読む