記事一覧へ戻る
ロボティクス・フィジカルAI

明示的な軌道なしで先読みする3D拡散ポリシー

読了目安 3 分

導入

ロボットの操作は、現在の画像を見て、その場で一つの動作を選ぶだけでは完結しない。把持や押し操作、物体の配置では、今できる動作だけでなく、物体とグリッパーの相互作用が次にどの方向へ進むかを考える必要がある。3D拡散ポリシーは現在の観測から幾何学的に整合した動作を生成する一方、こうした先読みは多くの場合、動作学習の中から暗黙的に現れることに任されていた。

大連理工大学の研究チームは、この問題に対して Movement Trend Guidance を提案した。これは明示的な計画軌道を生成するのではなく、短い観測履歴からインタラクションの進行を表す潜在表現を作り、動作生成の条件として利用する方法である。ベースにはDP3を用い、密な動作出力とreceding-horizon方式は維持している。

手法のポイント

  • 短い履歴から変化の傾向を抽出:現在のフレームだけでなく、短い観測履歴を入力し、インタラクションの状態がどう変化しているかをコンパクトな潜在変数にまとめる。
  • 未来情報は訓練時だけ利用:訓練では、まばらに与えた未来のグリッパー状態で潜在表現を監督する。推論時には未来状態を入力せず、観測履歴から得た潜在表現だけを利用する。
  • 全体条件付けとボトルネック制御:潜在表現は動作生成のグローバルな条件となる。さらにUNetのボトルネックにゲート付きFiLM分岐を加え、重要な特徴段階でトレンド情報を反映させる。
  • 明示的な軌道計画は不要:提案手法は完全なウェイポイント列を作るプランナーではない。元の拡散ポリシーが持つ密な動作生成と逐次的な再計画をそのまま利用できる。

報告された結果

50タスクを混合して学習するRoboTwin2.0では、提案手法の成功率は62.8%、DP3は56.1%だった。LIBERO-40では71.93%対37.08%、5つの実機タスクでは72.0%対49.0%となっている。論文によれば、追加パラメータは3.52%にとどまり、RoboTwin2.0、LIBERO-40、DexArtの評価でDP3を一貫して上回った。

この結果が示すのは、ポリシーに明確な未来軌道を与えなくても、将来の状態によって訓練された潜在的なトレンド表現が、動作の方向性を与えられるという点である。

意義と今後の課題

本研究は、インタラクションの進行を推定する機能と、次の具体的な動作を生成する機能を、明示的な二段階計画にせず連携させた。これにより、拡散モデルの柔軟な動作生成を維持しながら、現在の観測だけに反応する局所的な制御を抑えられる可能性がある。追加コストが小さいため、既存の3D拡散ポリシーへの拡張として検証しやすい点も特徴だ。

一方、提示された素材には、観測履歴の長さ、未来状態の疎密、潜在表現の設計を比較する詳細なアブレーションは含まれていない。異なるタスクで潜在表現がどれほど解釈可能か、観測ノイズにどの程度頑健か、長時間の複雑な操作へ移行できるかは、今後の検証課題となる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
VABench、マルチモーダルモデルの身体的な空間知能を検証
ロボティクス・フィジカルAI
cctest.ai

VABench、マルチモーダルモデルの身体的な空間知能を検証

VABenchは、物体の位置を説明できるかだけでなく、不足した視覚情報を自ら集め、共通の空間座標で推論し、メートル単位の行動を実行してフィードバックから修正できるかを評価する。結果は、局所的な空間理解と安定したロボット操作の間に大きな差があることを示した。

続きを読む
CCTest · Blog
Vantora、1億ドルを調達し産業向け専用フィジカルAIに注力
ロボティクス・フィジカルAI
cctest.ai

Vantora、1億ドルを調達し産業向け専用フィジカルAIに注力

UP.Labsから社名を変更したVantoraが、Silversmithから1億ドルを調達した。産業企業向けにフィジカルAIのスタートアップを構築し、顧客企業が自社事業へ取り込めるモデルへ転換する。

続きを読む
CCTest · Blog
GPT-Policy:文脈から学習する適応型ロボット
ロボティクス・フィジカルAI
cctest.ai

GPT-Policy:文脈から学習する適応型ロボット

GPT-Policyは、視覚言語モデル、文脈コンパイラ、制約付きコントローラを組み合わせ、勾配更新なしでロボットが実演やフィードバックから新しいタスクに適応することを目指す。実ロボット実験では、人間の動画実演がタスク達成を改善し、接触を伴う作業では動作に対応した参照情報がさらに有効だった。

続きを読む