記事一覧へ戻る
世界モデル

InternW0、予測から実行可能な制御へ進む物理世界モデル

読了目安 4 分

はじめに

ロボット向けの世界モデルに求められるのは、次に何が起きるかを映像として予測することだけではない。環境が変化し、観測が不完全なままでも、その予測をすぐに行動へ変換し、必要に応じて修正できなければならない。上海人工知能研究所が発表した InternW0 は、この「予測」と「制御」の隔たりを埋めることを狙った物理世界モデルである。InternW 物理世界モデルシリーズの最初の実装として、現実環境での非同期処理と効率的なインタラクションを重視している。

設計上のポイント

InternW0の特徴は、動画理解と行動生成を同じ速度で処理しようとしない点にある。

  • 時間スケールの異なる専門家:高容量の映像エキスパートが長い時間範囲の未来予測と文脈を提供し、軽量な行動エキスパートがより高い頻度で連続制御を出力する。これにより、長期的な見通しとリアルタイムな反応の両立を目指す。
  • 未来の再生成を抑制:新しい観測が入るたびに未来全体を作り直すのではなく、各層のK/Vキャッシュを再利用する。観測条件付きの文脈ルーティングによって、既存の予測文脈を新しい状態に適応させる設計だ。
  • 異なる身体を扱うインターフェース:ドメイン固有のインターフェースとソフトプロンプトを用い、ロボット本体、センサー、制御形式の違いを吸収する。特定のハードウェアだけに依存しない物理モデルを目指している。
  • 接触情報を追加:視覚だけでは、物体との接触、加わっている力、操作の安定性を十分に判断できない場合がある。そこで後学習に力覚と触覚信号を取り入れ、接触の多い操作に対応する。

データと評価

モデルの学習には、ロボットデータと一人称視点データを合わせた約7,200時間の異種データが使われた。その中には、実験室で収集した275時間の一人称視点データセット EgoLab も含まれる。評価はシミュレーションベンチマークだけでなく、現実の科学作業にも及ぶ。具体的には、15段階の金属有機構造体合成ワークフローと、接触・力覚を必要とする5段階の汎用定量ピペッティング操作が挙げられている。

ただし、提供された素材には詳細な結果表、比較対象、全タスク共通の評価指標は含まれていない。そのため、InternW0がどの手法をどれだけ上回るかを断定することはできない。一方で、複数段階の実行、実験室環境、液体や器具との精密な接触を含む課題を選んでいることから、短い単発操作だけではない実用的な検証を意図したことは読み取れる。

意義と残された課題

InternW0の意義は、長期予測と高速制御を別の計算負荷として整理し、それらをキャッシュとルーティングで接続した点にある。大きなモデルが将来について広い見通しを保ち、小さなモデルが最新の観測に応じて動作を更新する。この構成は、毎回の制御周期で重い映像予測をやり直す必要を減らす可能性がある。

この考え方は、実験室の自動化と相性がよい。化学的な手順は段階的な計画を必要とする一方、ピペッティングのような操作では、わずかな接触状態や力の違いが結果に影響しうる。力覚・触覚を組み込む設計は、視覚中心の制御が抱える限界への実務的な対応といえる。

今後の焦点は、異なるロボット間での移植性、K/V再利用による遅延削減の規模、各構成要素が性能に与える寄与である。完全な論文、アブレーション、失敗事例が必要だが、InternW0は物理世界モデルをオフラインの未来生成から、行動に結び付いた継続的な予測へ移行させる一つの方向性を示している。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
JEPA-Anything:異なる世界を横断する因子分解型ワールドモデル
世界モデル
cctest.ai
世界モデル

JEPA-Anything:異なる世界を横断する因子分解型ワールドモデル

JEPA-Anythingは、潜在表現を相補的な因子へ分解する「直交予測因子分解」をJEPAに組み込み、複数分野の世界モデルを共通の設計で扱う手法です。視覚、生物、臨床、制御、分子動力学、物理場、気象で評価されています。

続きを読む