記事一覧へ戻る
世界モデル

NVIDIA Cosmos-H-Dreams、外科ロボット向け世界モデルをリアルタイム化

読了目安 3 分

導入

外科ロボットは遠隔操作中心の段階から、視覚・言語・行動を統合する方策へ進みつつある。しかし、その訓練と評価は容易ではない。実機プラットフォームは高価で、実験の再現には時間がかかり、失敗すれば器具や生体材料を傷つける可能性もある。従来型シミュレータは安全性を高める一方で、柔らかい組織、縫合糸、針、反射面、煙、遮蔽、微細な器具接触を十分に表現するのが難しい。

NVIDIA が紹介した Cosmos-H-Dreams は、この課題に対して学習済み世界モデルを用いるアプローチだ。物体や相互作用をすべて手作業で記述するのではなく、同期された手術映像とロボット運動学から視覚的ダイナミクスを学び、操作に応じた映像をリアルタイムに生成する。

主要ポイント

  • オフライン生成から閉ループ操作へ:従来の Cosmos-H-Surgical-Simulator は、初期フレームと将来のロボット軌道から手術映像を生成し、オフライン評価や合成データ作成に使われていた。Cosmos-H-Dreams はこれを対話的な領域に移し、初期 RGB フレームとライブの運動学データから次のフレーム群を連続生成する。
  • dVRK 卓上縫合に特化:公開モデルは da Vinci Research Kit の卓上縫合を対象に特化されている。多様な手術ロボットから得た事前知識を基盤に、双腕 dVRK の相対的な並進、回転、グリッパ状態を共通の行動表現へ写像して扱う。
  • 失敗例も学習に含める:教師モデルは JHU dVRK 卓上データ混合で微調整され、成功デモだけでなく、針の落下、投げ損ない、結紮失敗などの失敗・分布外エピソードも含む。評価用シミュレータには、理想的な動きだけでなく悪い行動の結果を再現する能力が必要だからだ。
  • 蒸留でリアルタイム化:Cosmos-H-Dreams は教師から学生への訓練パイプラインを採用する。因果 warmup によりストリーミング attention と KV cache の扱いを学ばせ、self-forcing distillation によって、自身が生成した履歴に条件付ける本番に近い状況で安定するよう訓練する。
  • FlashDreams による高速推論:リアルタイム性はモデル蒸留だけではなく、推論基盤にも依存する。FlashDreams はストリーミング KV cache、CUDA Graph capture、モデルコンパイルなどを使い、単一の NVIDIA RTX PRO 6000 上で約 160 FPS の対話的動作に到達するとされる。

意義と影響

この発表の要点は、単に手術らしい動画を作ることではない。生成された場面が操作に素早く、かつ一貫して反応し、人間の操作者や学習済み方策が閉ループで環境に入れることにある。原文では、WebRTC によるブラウザ操作、WebXR を使った Meta Quest 連携、学習済み手術方策との接続が説明されている。

外科ロボット研究にとって、これは実機で危険な動作を繰り返す前に、方策評価や失敗ケース探索、追加データ生成を行う道を広げる。ただし、生成品質だけでは信頼できるシミュレータとは言えない。ツール先端の到達・姿勢精度、グリッパ動作の忠実性、静止時安定性、反実仮想行動の多様性、長時間ドリフト、実機方策結果との一致を検証する必要がある。

こうした検証が進めば、リアルタイム世界モデルは高リスクな身体性 AI の開発基盤になり得る。Cosmos-H-Dreams は、動画予測モデルから外科ロボット向けの対話的世界モデルへ向かう一歩と位置づけられる。

出典:Hugging Face Blog

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
UniWorld-ViewがWorldScore首位に:1枚の画像から制御可能な新視点動画へ
世界モデル
cctest.ai
世界モデル

UniWorld-ViewがWorldScore首位に:1枚の画像から制御可能な新視点動画へ

兔展智能、北京大学、鵬城実験室が開発した UniWorld-View が、李飛飛氏のチームに関連する WorldScore ランキングで首位に立った。単一画像または単眼動画から、指定したカメラ軌道に沿う新視点動画を生成できる点が注目されている。

続きを読む
CCTest · Blog
ABot-World-0:単一デスクトップGPUで動くリアルタイム世界モデル
世界モデル
cctest.ai
世界モデル

ABot-World-0:単一デスクトップGPUで動くリアルタイム世界モデル

ABot-World-0 は、映像生成をユーザー操作に反応する世界モデルとして再構成する研究です。データ収集、長時間ロールアウトの蒸留、低ビット推論を組み合わせ、単一の RTX 5090 上で 720P のストリーミング生成を目指します。

続きを読む