記事一覧へ戻る
ロボティクス・フィジカルAI

N₀-TWAM:ロボット世界モデルに「触覚予測」を組み込む試み

読了目安 3 分

導入

ロボットの操作では、カメラ映像だけでは足りない場面が多い。差し込み、把持、押し込み、位置合わせのような接触を伴うタスクでは、物体にどの程度触れているか、力がどう変化しているかが成否を左右する。N₀-TWAM は、この触覚情報を単なる補助入力ではなく、世界モデルが予測すべき中心的な信号として扱う。

この研究が提案するのは、接触リッチな操作のための触覚ネイティブな world-action model である。モデルは将来の視覚情報と将来の接触情報を同時に予測し、その予測された未来から行動を導く。

核心ポイント

  • 視覚と触覚を同時に未来予測:N₀-TWAM は、触覚を後付けのセンサー情報として扱うのではなく、未来の映像と同じ因果ステップで未来の接触を予測する。
  • 大規模な視覚・触覚共同学習:触覚を豊富に含むデモを用いて事前学習を行い、その範囲は 6 種類の身体形態と 450 タスクに及ぶ。
  • NeoForce による統一表現:NeoForce は力に基づく触覚表現であり、行動生成を物理的に意味のある接触信号で条件付けるために使われる。
  • 接触イベントによる段階管理:長い時間軸や複数段階の操作に対応するため、触覚接触イベントをタスクの節目として使い、実行中に段階を進める。
  • リアルタイム性を意識した構成:非対称 Mixture-of-Transformers により、映像予測には幅の広い専門家、行動と触覚予測には軽量な専門家を割り当てる。

意義と影響

この研究の重要性は、触覚を含む世界モデルを大規模学習の対象として明確に位置づけた点にある。精密な操作では、見た目が正しくても接触状態が不適切であれば失敗する。強くつかみすぎる、弱すぎる、差し込み位置は合っているように見えるが接触がずれている、といった問題は視覚だけでは検出しにくい。

N₀-TWAM は、ロボットに「これから何が見え、何にどう触れ、どの行動を取るべきか」をまとめて予測させることで、接触中心の操作能力を高めようとしている。素材では実機とシミュレーションのベンチマークで有効性が示されたとされるが、汎化性能、触覚センサー間の適応、実運用での安定性については、今後の公開コードやチェックポイントを用いた検証が重要になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
CS-JEPA:群ロボットが局所情報だけで同じ未来を予測する仕組み
ロボティクス・フィジカルAI
cctest.ai

CS-JEPA:群ロボットが局所情報だけで同じ未来を予測する仕組み

ITMO University らの論文は、群ロボット向けの分散型予測アーキテクチャ Collective-State JEPA を提案した。各ロボットは局所履歴と限られた通信だけで、同じ将来の集団状態を表す表現を出力する。

続きを読む
CCTest · Blog
SGTP:ゲーム理論とGPUサンプリングで多車両自動運転レースを計画
ロボティクス・フィジカルAI
cctest.ai

SGTP:ゲーム理論とGPUサンプリングで多車両自動運転レースを計画

SGTP は、多車両の自動運転レースにおける激しい相互作用を扱うため、ゲーム理論的推論と GPU 加速サンプリングを組み合わせたリアルタイム計画フレームワークです。

続きを読む