記事一覧へ戻る
世界モデル

NVIDIA Cosmos-H-Dreams、外科ロボット向け世界モデルをリアルタイム化

読了目安 3 分

導入

外科ロボットは遠隔操作中心の段階から、視覚・言語・行動を統合する方策へ進みつつある。しかし、その訓練と評価は容易ではない。実機プラットフォームは高価で、実験の再現には時間がかかり、失敗すれば器具や生体材料を傷つける可能性もある。従来型シミュレータは安全性を高める一方で、柔らかい組織、縫合糸、針、反射面、煙、遮蔽、微細な器具接触を十分に表現するのが難しい。

NVIDIA が紹介した Cosmos-H-Dreams は、この課題に対して学習済み世界モデルを用いるアプローチだ。物体や相互作用をすべて手作業で記述するのではなく、同期された手術映像とロボット運動学から視覚的ダイナミクスを学び、操作に応じた映像をリアルタイムに生成する。

主要ポイント

  • オフライン生成から閉ループ操作へ:従来の Cosmos-H-Surgical-Simulator は、初期フレームと将来のロボット軌道から手術映像を生成し、オフライン評価や合成データ作成に使われていた。Cosmos-H-Dreams はこれを対話的な領域に移し、初期 RGB フレームとライブの運動学データから次のフレーム群を連続生成する。
  • dVRK 卓上縫合に特化:公開モデルは da Vinci Research Kit の卓上縫合を対象に特化されている。多様な手術ロボットから得た事前知識を基盤に、双腕 dVRK の相対的な並進、回転、グリッパ状態を共通の行動表現へ写像して扱う。
  • 失敗例も学習に含める:教師モデルは JHU dVRK 卓上データ混合で微調整され、成功デモだけでなく、針の落下、投げ損ない、結紮失敗などの失敗・分布外エピソードも含む。評価用シミュレータには、理想的な動きだけでなく悪い行動の結果を再現する能力が必要だからだ。
  • 蒸留でリアルタイム化:Cosmos-H-Dreams は教師から学生への訓練パイプラインを採用する。因果 warmup によりストリーミング attention と KV cache の扱いを学ばせ、self-forcing distillation によって、自身が生成した履歴に条件付ける本番に近い状況で安定するよう訓練する。
  • FlashDreams による高速推論:リアルタイム性はモデル蒸留だけではなく、推論基盤にも依存する。FlashDreams はストリーミング KV cache、CUDA Graph capture、モデルコンパイルなどを使い、単一の NVIDIA RTX PRO 6000 上で約 160 FPS の対話的動作に到達するとされる。

意義と影響

この発表の要点は、単に手術らしい動画を作ることではない。生成された場面が操作に素早く、かつ一貫して反応し、人間の操作者や学習済み方策が閉ループで環境に入れることにある。原文では、WebRTC によるブラウザ操作、WebXR を使った Meta Quest 連携、学習済み手術方策との接続が説明されている。

外科ロボット研究にとって、これは実機で危険な動作を繰り返す前に、方策評価や失敗ケース探索、追加データ生成を行う道を広げる。ただし、生成品質だけでは信頼できるシミュレータとは言えない。ツール先端の到達・姿勢精度、グリッパ動作の忠実性、静止時安定性、反実仮想行動の多様性、長時間ドリフト、実機方策結果との一致を検証する必要がある。

こうした検証が進めば、リアルタイム世界モデルは高リスクな身体性 AI の開発基盤になり得る。Cosmos-H-Dreams は、動画予測モデルから外科ロボット向けの対話的世界モデルへ向かう一歩と位置づけられる。

出典:Hugging Face Blog

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
世界モデルで自動研究エージェントの強化学習を拡張する
世界モデル
cctest.ai
世界モデル

世界モデルで自動研究エージェントの強化学習を拡張する

自動研究エージェントの強化学習では、解を生成することよりも実験の実行がボトルネックになり得ます。WMRLは世界モデルで実行結果を予測し、バイアス補正とノイズ低減を組み合わせて学習を高速化します。

続きを読む
CCTest · Blog
プログラマブル・ワールドモデルが動画生成に持続的な状態を与える
世界モデル
cctest.ai
世界モデル

プログラマブル・ワールドモデルが動画生成に持続的な状態を与える

Programmable World Model は、インタラクティブ動画モデルが長時間のやり取りで世界の状態やルールを維持しにくい問題に取り組む。世界の状態変化を実行可能なプログラムで管理し、動画モデルは主に視覚的な描画を担う。

続きを読む
CCTest · Blog
OpenWAM:世界知識とロボット行動の事前学習を開放的に検証
世界モデル
cctest.ai
世界モデル

OpenWAM:世界知識とロボット行動の事前学習を開放的に検証

OpenWAMは、世界モデルの知識を実行可能なロボット行動へ変換する研究を、モジュール化された実験基盤として整理する。制御実験を通じて、知識の移転、世界学習と行動学習の協調、身体データによる汎化を分析した。

続きを読む