記事一覧へ戻る
ロボティクス・フィジカルAI

N₀-TWAM:ロボット世界モデルに「触覚予測」を組み込む試み

読了目安 3 分

導入

ロボットの操作では、カメラ映像だけでは足りない場面が多い。差し込み、把持、押し込み、位置合わせのような接触を伴うタスクでは、物体にどの程度触れているか、力がどう変化しているかが成否を左右する。N₀-TWAM は、この触覚情報を単なる補助入力ではなく、世界モデルが予測すべき中心的な信号として扱う。

この研究が提案するのは、接触リッチな操作のための触覚ネイティブな world-action model である。モデルは将来の視覚情報と将来の接触情報を同時に予測し、その予測された未来から行動を導く。

核心ポイント

  • 視覚と触覚を同時に未来予測:N₀-TWAM は、触覚を後付けのセンサー情報として扱うのではなく、未来の映像と同じ因果ステップで未来の接触を予測する。
  • 大規模な視覚・触覚共同学習:触覚を豊富に含むデモを用いて事前学習を行い、その範囲は 6 種類の身体形態と 450 タスクに及ぶ。
  • NeoForce による統一表現:NeoForce は力に基づく触覚表現であり、行動生成を物理的に意味のある接触信号で条件付けるために使われる。
  • 接触イベントによる段階管理:長い時間軸や複数段階の操作に対応するため、触覚接触イベントをタスクの節目として使い、実行中に段階を進める。
  • リアルタイム性を意識した構成:非対称 Mixture-of-Transformers により、映像予測には幅の広い専門家、行動と触覚予測には軽量な専門家を割り当てる。

意義と影響

この研究の重要性は、触覚を含む世界モデルを大規模学習の対象として明確に位置づけた点にある。精密な操作では、見た目が正しくても接触状態が不適切であれば失敗する。強くつかみすぎる、弱すぎる、差し込み位置は合っているように見えるが接触がずれている、といった問題は視覚だけでは検出しにくい。

N₀-TWAM は、ロボットに「これから何が見え、何にどう触れ、どの行動を取るべきか」をまとめて予測させることで、接触中心の操作能力を高めようとしている。素材では実機とシミュレーションのベンチマークで有効性が示されたとされるが、汎化性能、触覚センサー間の適応、実運用での安定性については、今後の公開コードやチェックポイントを用いた検証が重要になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
GPT-Policy:文脈から学習する適応型ロボット
ロボティクス・フィジカルAI
cctest.ai

GPT-Policy:文脈から学習する適応型ロボット

GPT-Policyは、視覚言語モデル、文脈コンパイラ、制約付きコントローラを組み合わせ、勾配更新なしでロボットが実演やフィードバックから新しいタスクに適応することを目指す。実ロボット実験では、人間の動画実演がタスク達成を改善し、接触を伴う作業では動作に対応した参照情報がさらに有効だった。

続きを読む
CCTest · Blog
小型AIモデルが戦場のドローンに自律性を与える
ロボティクス・フィジカルAI
cctest.ai

小型AIモデルが戦場のドローンに自律性を与える

NATO関連プログラムに参加するScaleout Systemsは、軽量な画像認識モデルをドローンや前線の計算機に実装し、中央サーバーとの常時接続なしで目標を識別できる仕組みを開発している。ALMA計画では、自律的な目標発見から攻撃任務までのデモも行われた。

続きを読む
CCTest · Blog
AgilityのDigit 5、人間を避けるため停止やしゃがみ動作に対応
ロボティクス・フィジカルAI
cctest.ai

AgilityのDigit 5、人間を避けるため停止やしゃがみ動作に対応

Agility Roboticsは、人間と同じ作業空間で動けるよう安全機能を強化した人型ロボット「Digit 5」を発表した。人を検知すると、回避、停止、しゃがみ動作などを選択する。

続きを読む