明示的な軌道なしで先読みする3D拡散ポリシー
導入
ロボットの操作は、現在の画像を見て、その場で一つの動作を選ぶだけでは完結しない。把持や押し操作、物体の配置では、今できる動作だけでなく、物体とグリッパーの相互作用が次にどの方向へ進むかを考える必要がある。3D拡散ポリシーは現在の観測から幾何学的に整合した動作を生成する一方、こうした先読みは多くの場合、動作学習の中から暗黙的に現れることに任されていた。
大連理工大学の研究チームは、この問題に対して Movement Trend Guidance を提案した。これは明示的な計画軌道を生成するのではなく、短い観測履歴からインタラクションの進行を表す潜在表現を作り、動作生成の条件として利用する方法である。ベースにはDP3を用い、密な動作出力とreceding-horizon方式は維持している。
手法のポイント
- 短い履歴から変化の傾向を抽出:現在のフレームだけでなく、短い観測履歴を入力し、インタラクションの状態がどう変化しているかをコンパクトな潜在変数にまとめる。
- 未来情報は訓練時だけ利用:訓練では、まばらに与えた未来のグリッパー状態で潜在表現を監督する。推論時には未来状態を入力せず、観測履歴から得た潜在表現だけを利用する。
- 全体条件付けとボトルネック制御:潜在表現は動作生成のグローバルな条件となる。さらにUNetのボトルネックにゲート付きFiLM分岐を加え、重要な特徴段階でトレンド情報を反映させる。
- 明示的な軌道計画は不要:提案手法は完全なウェイポイント列を作るプランナーではない。元の拡散ポリシーが持つ密な動作生成と逐次的な再計画をそのまま利用できる。
報告された結果
50タスクを混合して学習するRoboTwin2.0では、提案手法の成功率は62.8%、DP3は56.1%だった。LIBERO-40では71.93%対37.08%、5つの実機タスクでは72.0%対49.0%となっている。論文によれば、追加パラメータは3.52%にとどまり、RoboTwin2.0、LIBERO-40、DexArtの評価でDP3を一貫して上回った。
この結果が示すのは、ポリシーに明確な未来軌道を与えなくても、将来の状態によって訓練された潜在的なトレンド表現が、動作の方向性を与えられるという点である。
意義と今後の課題
本研究は、インタラクションの進行を推定する機能と、次の具体的な動作を生成する機能を、明示的な二段階計画にせず連携させた。これにより、拡散モデルの柔軟な動作生成を維持しながら、現在の観測だけに反応する局所的な制御を抑えられる可能性がある。追加コストが小さいため、既存の3D拡散ポリシーへの拡張として検証しやすい点も特徴だ。
一方、提示された素材には、観測履歴の長さ、未来状態の疎密、潜在表現の設計を比較する詳細なアブレーションは含まれていない。異なるタスクで潜在表現がどれほど解釈可能か、観測ノイズにどの程度頑健か、長時間の複雑な操作へ移行できるかは、今後の検証課題となる。
コメント
ログイン状態を確認中…
コメントを読み込み中…