EyeRobot 2.0:手首カメラなしで実現する能動注視マニピュレーション
概要
ロボットの精密操作では、固定カメラだけでは対象物を見失う場面がある。アームが物体に近づいたとき、対象が別のアームに遮られたとき、あるいは両手で狭い場所を扱うときだ。そこで多くのシステムは手首カメラを追加する。しかし、センサー、配線、キャリブレーション、推論入力が増える。EyeRobot 2.0は、手首カメラを足す代わりに、ロボット自身が視線を動かして局所的な情報を得る方法を検討する。
技術の要点
- 能動的な視覚注視:単一のステレオカメラに接続された2つの可動視点を使い、シーン内の3D注視点へ視線を合わせる。カメラは受動的な記録装置ではなく、制御ループの一部になる。
- 中心に計算を集中:注視画像の中心へ多くの視覚トークンを割り当て、周辺はより圧縮して扱う。人間の中心視に近い発想で、現在の操作に関係する対象や接触部を重点的に処理する。
- 階層的な注視制御:低レベルの視線サーボポリシーは、目標物体に視点を合わせる。上位のターゲット選択器は、タスクの進行に応じて次の注視先を選ぶ。前者は幾何学的な密な報酬で、後者は把持の行動クローニングポリシーと協調しながら、強化学習で訓練される。
- 注視点基準の行動表現:グリッパー情報を注視点に対する SE(3) 座標系へ変換する。これにより、行動を常にシーン全体の座標で表す必要がなくなり、学習する分布を小さくできる可能性がある。
評価から読み取れること
研究チームは7種類の実世界タスクと6種類のシミュレーションタスクについて遠隔操作データを収集し、実機で1000回超、シミュレーションで1800回の試行を行った。比較対象は、能動注視、受動ステレオ視覚、そして自己視点と手首カメラを組み合わせたポリシーである。
重要なのは、単にカメラを減らしたことではない。注視先の決定、視点の調整、画像中心へのトークン配分、把持行動の座標表現を一つの閉ループに組み込んだ点にある。一方、提示された素材には各手法の成功率や具体的な差分がない。そのため、EyeRobot 2.0があらゆるタスクで基線を上回ると結論づけることはできない。
意義と今後の課題
この研究は、手首カメラの削減を単なるセンサー除去ではなく、「物理的な注意」の設計問題として捉え直している。ロボットが必要な対象を選び、その場所へ視点を動かし、注視点を中心とした座標で動作すれば、より少ないカメラでも局所的な視覚フィードバックを得られるかもしれない。
ただし、能動注視には新たな依存関係も生じる。注視がずれれば認識が崩れ、注視のタイミングが悪ければ操作を妨げる。実時間性、遮蔽や接触への頑健性、未学習タスクへの汎化が、今後の評価で重要になる。
コメント
ログイン状態を確認中…
コメントを読み込み中…