記事一覧へ戻る
ロボティクス・フィジカルAI

元ファーウェイ幹部が物理基盤モデルに挑戦、具身知能のScaling Lawを探る

読了目安 3 分

導入

大規模言語モデルは、大量のテキストを事前学習することで、質問応答やコーディングなど複数の作業にまたがる能力を獲得してきた。一方、ロボットは依然として、機体、環境、作業ごとにデータを集め、モデルを調整することが多い。元ファーウェイのクラウド大規模モデル責任者である李寅氏と、元マルチモーダル首席研究者の張含望氏が設立した息壤開物は、この差を埋める物理世界向けの基盤モデルを構想している。名称はLPM(Large Physics Model)だ。

要点

  • 資金と体制:同社はシードおよびエンジェルラウンドで数億元を調達し、評価額は約5億ドルと説明している。組織はモデル、データ、システム基盤の三つの機能に分かれる。
  • 狙い:画像の内容を認識するだけでなく、物体の運動、行動による環境変化、結果に至る因果関係を理解し、機体や作業が変わっても能力を移転できるモデルを目指す。
  • データと構成:インターネット上の物理動画、一人称視点データ、教示、シミュレーション、公開ロボット軌跡、実機フィードバックを組み合わせる。中核は統一型の自己回帰Transformerで、連続的な未来状態や動画の生成には拡散モデルを使う構想だ。
  • 三段階の能力:L0は汎用物理基盤モデル、L1は産業などの領域モデル、L2は具体的なロボット作業への展開を担う。

なぜ物理基盤モデルなのか

具身知能は、変化し続ける環境で連続的に判断しなければならない。机の片付けだけでも、物体の認識、順番の決定、経路計画、動作後の状態変化への対応が必要になる。判断の回数が増えるほど行動の組み合わせは急増し、特定作業の実演データだけでは十分に覆いきれない。

息壤開物の考え方は、現在の状態、行動、次の状態を一つの予測過程として扱うことだ。未来をすべて列挙するのではなく、現在の状態から行動を選び、結果を受けて次の判断を行う。共通トークン、強化学習、データ基盤、評価、計算基盤を一つの学習ループに組み込むとしている。

意義と未解決の課題

この構想の価値は、ロボット開発を「導入ごとに再訓練する」方式から、学習済みの物理知識を再利用する方式へ近づける点にある。物理知能にも言語モデルに似たスケーリング効果が存在するなら、データやモデルの拡大によって汎化性能が伸びる可能性がある。同社はWorld Arena 2.0の関連トラックで軌跡精度が1位、物理的一貫性が2位だったこと、また訓練規模の拡大に伴う初期の性能向上を説明している。ただし、いずれも企業側の開示であり、独立評価が必要だ。

動画で見られる相関が、そのまま因果的で実行可能な知識になるとは限らない。シミュレーションから実機への移行、長期計画、データ品質、訓練費用、安全性、機体をまたぐ汎化が成否を左右する。予定されているXIRRA v0.1は、このアプローチを評価する初期の節目になりそうだ。

出典:量子位

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ロボットは自己対戦でサッカーを学べるか、Skild AIの具身AI実験
ロボティクス・フィジカルAI
cctest.ai

ロボットは自己対戦でサッカーを学べるか、Skild AIの具身AI実験

Skild AIは、過去の自分自身のモデルと対戦しながら、ドリブルやボールキープ、タックル、転倒からの起き上がりを学ぶヒューマノイドロボットを公開しました。人間が動作を一つずつ教える必要を減らす、具身AIの新しい訓練方法を示す事例です。

続きを読む
CCTest · Blog
RoboFollowが暴く、具現化エージェントの指示追従の幻影
ロボティクス・フィジカルAI
cctest.ai

RoboFollowが暴く、具現化エージェントの指示追従の幻影

ロボットの高いタスク成功率は、指示を理解した証拠とは限りません。RoboFollowは、視覚だけで答えが決まる低エントロピーの場面では、モデルが言語をほとんど使わずに成功できることを示します。

続きを読む