HuRo, 인간 영상을 확장 가능한 VLA 사전학습 데이터로 변환
배경
비전-언어-행동 모델(VLA)을 로봇 제어에 적용하려면 이미지와 지시문뿐 아니라, 관측이 어떤 행동으로 이어지는지 보여주는 궤적이 필요하다. 하지만 실제 로봇으로 다양한 데이터를 수집하는 일은 비용이 크고, 작업과 환경의 범위도 제한되기 쉽다. 반면 인간이 촬영한 조작 영상은 풍부하지만, 인간과 로봇은 카메라 시점, 신체 구조, 움직임의 제약이 다르다. 따라서 영상을 그대로 로봇 시연 데이터로 사용할 수는 없다.
HuRo는 인간 영상을 로봇 중심의 감독 신호로 변환하면 VLA 사전학습을 확장할 수 있는지를 체계적으로 살핀 연구다. 핵심은 인간과 로봇의 차이를 시각 정보만으로 줄이는 것이 아니라, 행동 대응 관계까지 함께 정렬하는 데 있다.
HuRo의 방법
HuRo는 서로 다른 인간 영상에서 로봇에 맞는 관측과 행동 궤적을 생성하는 로봇화 파이프라인을 구축했다. 주요 구성은 다음과 같다.
- 시각 로봇화: 인간의 1인칭 영상 정보를 로봇 카메라의 시점과 지각 형식에 가까운 관측 신호로 변환한다.
- 동작 리타기팅: 인간의 조작 과정을 로봇이 사용할 수 있는 행동 궤적으로 재구성한다.
- 중간 신호 추론: 영상 소스마다 다른 주석 수준과 누락된 정보를 보완해 여러 단계의 감독 신호를 만든다.
연구진은 이 과정을 5개 인간 영상 소스에 적용해 약 63만 개의 로봇화 에피소드와 1억4200만 개의 처리 프레임으로 구성된 HuRo 데이터셋을 만들었다. 단순히 인간 영상을 시각 데이터로 추가하는 대신, 로봇이 학습할 수 있는 관측과 행동의 형태로 변환했다는 점이 특징이다.
실험 결과
4개 실제 환경 조작 과제에서 로봇화 사전학습 데이터의 양을 늘리자 전체 완료율은 51.5%에서 80.3%로 상승했다. 공간 배치와 시각적 외관이 달라지는 분포 외 조건에서도 완료율은 34.9%에서 72.2%로 높아졌다. 이는 HuRo가 익숙한 장면에 대한 적합도뿐 아니라, 환경 변화에 대응하는 능력에도 기여할 수 있음을 보여준다.
추가 분석에서는 시각 로봇화가 분포 외 강건성을 높이는 데 효과적인 것으로 나타났다. 그러나 시각 정보만 옮기는 방식보다, 리타기팅된 행동을 포함해 엔드투엔드로 사전학습하는 방식이 더 우수했다. 장면의 외관을 맞추는 것도 중요하지만, 조작이 어떻게 진행되는지를 행동 감독으로 전달하는 것이 로봇 제어에는 더 직접적인 도움이 된다는 의미다.
의미와 과제
HuRo는 모든 학습 사례를 실제 로봇으로 수집하는 대신, 인간 영상에서 물체 상호작용과 작업 구조, 시각적 다양성을 먼저 학습하는 확장 경로를 제시한다. 실제 로봇 데이터는 이후 실행 가능성 확인과 특정 하드웨어에 맞춘 조정에 집중할 수 있다.
다만 영상에서 추론한 관측과 행동의 품질은 여전히 중요하며, 로봇 형태가 달라지면 추가적인 적응이 필요할 수 있다. 따라서 HuRo는 실제 로봇 데이터를 완전히 대체하기보다 보완하는 사전학습 자원으로 보는 편이 타당하다. 관측과 행동을 함께 정렬하면 인간 영상도 대규모 VLA 학습에 활용할 수 있는 로봇 경험으로 바뀔 수 있다는 점이 이 연구의 핵심 시사점이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…