명시적 궤적 없이 앞을 내다보는 3D 확산 정책
들어가며
로봇 조작은 현재 화면을 보고 즉시 하나의 행동을 고르는 문제로 끝나지 않는다. 물체를 잡거나 밀고 배치하는 과정에서는 지금 가능한 움직임뿐 아니라, 물체와 그리퍼의 상호작용이 다음에 어떤 방향으로 전개될지도 고려해야 한다. 3D 확산 정책은 현재 관측으로부터 기하학적으로 타당한 행동을 생성하는 데 강점이 있지만, 이런 선견 능력은 대체로 행동 학습 과정에서 암묵적으로 형성되도록 맡겨져 있었다.
대련이공대학교 연구팀은 이 문제를 위해 Movement Trend Guidance를 제안했다. 이 방법은 명시적인 미래 궤적을 먼저 계획하지 않고, 짧은 관측 이력에서 상호작용의 진행 상황을 나타내는 압축된 잠재 표현을 학습해 행동 생성의 조건으로 활용한다. DP3를 기반으로 하며, 기존의 밀집 행동 예측과 receding-horizon 실행 방식은 그대로 유지한다.
핵심 아이디어
- 짧은 이력에서 변화 추세를 학습: 현재 프레임 하나에만 의존하지 않고 짧은 관측 이력을 사용해 상호작용 상태가 어떻게 변하고 있는지를 잠재 변수에 담는다.
- 미래 정보는 학습 때만 사용: 학습 단계에서는 성긴 미래 그리퍼 상태가 잠재 표현을 감독한다. 추론 단계에서는 미래 상태를 입력하지 않고, 관측 이력에서 얻은 잠재 표현만 사용한다.
- 전역 조건과 병목 지점 조절을 결합: 잠재 표현은 행동 생성의 전역 조건으로 들어간다. 동시에 UNet 병목에 게이트가 있는 FiLM 분기를 추가해 중요한 특징 단계에서 추세 정보를 반영한다.
- 완전한 궤적 계획기는 추가하지 않음: 이 방법은 미래 웨이포인트를 모두 생성하는 별도 플래너가 아니다. 기존 확산 정책의 밀집 행동 출력과 순차적 재계획 과정을 유지하면서 방향성 정보만 보강한다.
결과
50개 과제를 혼합 학습한 RoboTwin2.0 설정에서 제안 방법의 성공률은 62.8%로, DP3의 56.1%보다 높았다. LIBERO-40에서는 71.93% 대 37.08%, 5개 실제 로봇 과제에서는 72.0% 대 49.0%의 결과가 보고됐다. 논문에 따르면 추가 파라미터는 3.52%에 불과하며, RoboTwin2.0, LIBERO-40, DexArt 평가 전반에서 DP3를 개선했다.
핵심적으로 이 연구는 로봇 정책이 미래의 모든 움직임을 명시적인 궤적으로 전달받지 않아도 선견 능력을 얻을 수 있음을 보여준다. 미래 상태를 이용해 학습한 잠재적인 추세 표현만으로도 행동 생성에 유용한 방향 정보를 제공할 수 있다는 주장이다.
의미와 남은 과제
이 연구는 상호작용이 어떻게 진행되는지 추정하는 기능과 다음 행동을 생성하는 기능을 명시적인 2단계 계획으로 분리하지 않고 연결한다. 그 결과 확산 모델의 유연한 행동 생성은 유지하면서, 현재 장면에만 반응하는 국소적 제어의 한계를 줄일 가능성이 있다. 파라미터 증가 폭이 작다는 점도 기존 3D 확산 정책에 추가 모듈로 적용하기에 유리하다.
다만 제공된 자료에는 관측 이력의 길이, 미래 감독 신호의 밀도, 추세 표현 설계에 대한 상세한 소거 실험이 포함되어 있지 않다. 잠재 표현이 과제마다 얼마나 해석 가능한지, 관측 잡음에 얼마나 강한지, 더 길고 복잡한 조작으로도 효과가 이어지는지는 추가 연구가 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…