元ファーウェイ幹部が物理基盤モデルに挑戦、具身知能のScaling Lawを探る
導入
大規模言語モデルは、大量のテキストを事前学習することで、質問応答やコーディングなど複数の作業にまたがる能力を獲得してきた。一方、ロボットは依然として、機体、環境、作業ごとにデータを集め、モデルを調整することが多い。元ファーウェイのクラウド大規模モデル責任者である李寅氏と、元マルチモーダル首席研究者の張含望氏が設立した息壤開物は、この差を埋める物理世界向けの基盤モデルを構想している。名称はLPM(Large Physics Model)だ。
要点
- 資金と体制:同社はシードおよびエンジェルラウンドで数億元を調達し、評価額は約5億ドルと説明している。組織はモデル、データ、システム基盤の三つの機能に分かれる。
- 狙い:画像の内容を認識するだけでなく、物体の運動、行動による環境変化、結果に至る因果関係を理解し、機体や作業が変わっても能力を移転できるモデルを目指す。
- データと構成:インターネット上の物理動画、一人称視点データ、教示、シミュレーション、公開ロボット軌跡、実機フィードバックを組み合わせる。中核は統一型の自己回帰Transformerで、連続的な未来状態や動画の生成には拡散モデルを使う構想だ。
- 三段階の能力:L0は汎用物理基盤モデル、L1は産業などの領域モデル、L2は具体的なロボット作業への展開を担う。
なぜ物理基盤モデルなのか
具身知能は、変化し続ける環境で連続的に判断しなければならない。机の片付けだけでも、物体の認識、順番の決定、経路計画、動作後の状態変化への対応が必要になる。判断の回数が増えるほど行動の組み合わせは急増し、特定作業の実演データだけでは十分に覆いきれない。
息壤開物の考え方は、現在の状態、行動、次の状態を一つの予測過程として扱うことだ。未来をすべて列挙するのではなく、現在の状態から行動を選び、結果を受けて次の判断を行う。共通トークン、強化学習、データ基盤、評価、計算基盤を一つの学習ループに組み込むとしている。
意義と未解決の課題
この構想の価値は、ロボット開発を「導入ごとに再訓練する」方式から、学習済みの物理知識を再利用する方式へ近づける点にある。物理知能にも言語モデルに似たスケーリング効果が存在するなら、データやモデルの拡大によって汎化性能が伸びる可能性がある。同社はWorld Arena 2.0の関連トラックで軌跡精度が1位、物理的一貫性が2位だったこと、また訓練規模の拡大に伴う初期の性能向上を説明している。ただし、いずれも企業側の開示であり、独立評価が必要だ。
動画で見られる相関が、そのまま因果的で実行可能な知識になるとは限らない。シミュレーションから実機への移行、長期計画、データ品質、訓練費用、安全性、機体をまたぐ汎化が成否を左右する。予定されているXIRRA v0.1は、このアプローチを評価する初期の節目になりそうだ。
出典:量子位
コメント
ログイン状態を確認中…
コメントを読み込み中…