사람 손의 능숙함을 로봇으로: Morphometric Imitation이 동작 전이부터 제로샷 제어까지 연결
들어가며
사람의 손과 물체가 상호작용하는 과정에는 잡기, 돌리기, 누르기, 여러 손가락의 협응처럼 정교한 조작에 필요한 정보가 풍부하게 담겨 있다. 따라서 인간 시연은 다지 로봇 손을 학습시키는 중요한 데이터원이 될 수 있다. 하지만 사람의 동작을 로봇에 그대로 복사하는 방식은 여러 한계를 가진다. 손가락 길이와 관절 배치, 가동 범위, 힘을 내는 방식이 다르기 때문이다. 겉으로 비슷한 자세를 만들더라도 물체와의 핵심 접촉이 사라지거나, 로봇이 실제로 수행할 수 없는 궤적이 될 수 있다.
UC 버클리 연구진과 공동 연구자들이 제안한 Morphometric Imitation은 이 문제를 형태 적응, 동역학 보정, 정책 학습의 세 단계로 나누어 해결하려 한다.
프레임워크의 구성
- 형태를 고려한 동작 전이. 첫 단계인 형태 측정 최적화(MMO)는 인간의 움직임을 서로 다른 구조의 로봇 손으로 매핑한다. 단순히 관절 궤적을 맞추는 것이 아니라, 인간 시연에서 형성된 손가락과 물체 사이의 접촉 관계를 보존하는 데 초점을 둔다. 이를 통해 자세는 비슷하지만 실제 파지가 무너지는 문제를 줄인다.
- 잔차 강화학습으로 실행 가능성 보완. 운동학적 전이 결과가 항상 로봇의 물리적 제약을 만족하는 것은 아니다. 두 번째 단계에서는 운동학적 기준 동작 위에 잔차 강화학습을 적용하고, 인간 동작에서 얻은 물체 자세와 접촉 정보를 이용해 궤적을 조정한다. 목표는 동역학적으로 실행 가능한 로봇 시연을 만드는 것이다.
- 시각운동 정책으로 증류. 세 번째 단계에서는 보정된 로봇 시연을 시각운동 정책으로 증류한다. 실제 배치 시 인간 동작을 완전히 재구성하는 절차에 의존하지 않고, 시각 입력에서 직접 행동을 생성하도록 만드는 구성이다.
실험에서 확인된 결과
연구진은 3종의 로봇 손과 10개 인간 손-물체 상호작용 과제를 대상으로 방법을 평가했다. 5개 기준 방법 중 가장 강한 방법과 비교했을 때, MMO는 모든 로봇 손에서 접촉 F1을 최소 8포인트 높였다. 이후 동역학적 동작 전이의 성공률도 최대 35포인트 개선됐다. 잔차 강화학습에 대한 소거 실험에서는 물체 자세 정보와 접촉 정보가 서로 보완적인 이점을 제공하는 것으로 나타났다.
학습된 시각운동 정책은 30개 물체를 대상으로 실제 환경에서 300회 시험을 수행했고, 제로샷 성공률 89.3%를 달성했다. 여기서 제로샷은 실제 배치 대상에 맞춘 추가적인 과제별 학습 없이 정책을 실행했다는 의미다. 인간 시연을 바로 학습시키기보다 접촉과 동역학 관점에서 먼저 보정하는 과정이 시뮬레이션에서 실제 로봇으로 넘어가는 간극을 줄일 수 있음을 보여준다.
의미와 남은 과제
이 연구의 핵심은 단순히 사람의 자세를 로봇의 자세로 바꾸는 데 있지 않다. 물체와의 접촉을 유지하는 문제와 로봇이 해당 동작을 물리적으로 수행할 수 있는지를 하나의 시연 생성 흐름 안에서 함께 다룬다. 접촉은 조작 성공 여부에 직접 영향을 주고, 동역학 보정은 그 궤적이 실제로 실행될 수 있는지를 결정한다. 두 요소를 결합하면 인간 데이터, 시뮬레이션 학습, 실기 제어 사이의 차이를 줄이는 데 도움이 될 수 있다.
다만 현재 제공된 자료만으로는 훨씬 다양한 손 구조, 심한 시각적 가림, 더 길고 복잡한 조작 순서에 대한 일반화 성능을 판단하기 어렵다. 인식 오차와 접촉 추정의 품질에 대한 민감도 역시 향후 검증이 필요한 부분이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…