아티클 목록으로
로보틱스·피지컬 AI

HuRo, 인간 영상을 확장 가능한 VLA 사전학습 데이터로 변환

약 3분 소요

배경

비전-언어-행동 모델(VLA)을 로봇 제어에 적용하려면 이미지와 지시문뿐 아니라, 관측이 어떤 행동으로 이어지는지 보여주는 궤적이 필요하다. 하지만 실제 로봇으로 다양한 데이터를 수집하는 일은 비용이 크고, 작업과 환경의 범위도 제한되기 쉽다. 반면 인간이 촬영한 조작 영상은 풍부하지만, 인간과 로봇은 카메라 시점, 신체 구조, 움직임의 제약이 다르다. 따라서 영상을 그대로 로봇 시연 데이터로 사용할 수는 없다.

HuRo는 인간 영상을 로봇 중심의 감독 신호로 변환하면 VLA 사전학습을 확장할 수 있는지를 체계적으로 살핀 연구다. 핵심은 인간과 로봇의 차이를 시각 정보만으로 줄이는 것이 아니라, 행동 대응 관계까지 함께 정렬하는 데 있다.

HuRo의 방법

HuRo는 서로 다른 인간 영상에서 로봇에 맞는 관측과 행동 궤적을 생성하는 로봇화 파이프라인을 구축했다. 주요 구성은 다음과 같다.

  • 시각 로봇화: 인간의 1인칭 영상 정보를 로봇 카메라의 시점과 지각 형식에 가까운 관측 신호로 변환한다.
  • 동작 리타기팅: 인간의 조작 과정을 로봇이 사용할 수 있는 행동 궤적으로 재구성한다.
  • 중간 신호 추론: 영상 소스마다 다른 주석 수준과 누락된 정보를 보완해 여러 단계의 감독 신호를 만든다.

연구진은 이 과정을 5개 인간 영상 소스에 적용해 약 63만 개의 로봇화 에피소드와 1억4200만 개의 처리 프레임으로 구성된 HuRo 데이터셋을 만들었다. 단순히 인간 영상을 시각 데이터로 추가하는 대신, 로봇이 학습할 수 있는 관측과 행동의 형태로 변환했다는 점이 특징이다.

실험 결과

4개 실제 환경 조작 과제에서 로봇화 사전학습 데이터의 양을 늘리자 전체 완료율은 51.5%에서 80.3%로 상승했다. 공간 배치와 시각적 외관이 달라지는 분포 외 조건에서도 완료율은 34.9%에서 72.2%로 높아졌다. 이는 HuRo가 익숙한 장면에 대한 적합도뿐 아니라, 환경 변화에 대응하는 능력에도 기여할 수 있음을 보여준다.

추가 분석에서는 시각 로봇화가 분포 외 강건성을 높이는 데 효과적인 것으로 나타났다. 그러나 시각 정보만 옮기는 방식보다, 리타기팅된 행동을 포함해 엔드투엔드로 사전학습하는 방식이 더 우수했다. 장면의 외관을 맞추는 것도 중요하지만, 조작이 어떻게 진행되는지를 행동 감독으로 전달하는 것이 로봇 제어에는 더 직접적인 도움이 된다는 의미다.

의미와 과제

HuRo는 모든 학습 사례를 실제 로봇으로 수집하는 대신, 인간 영상에서 물체 상호작용과 작업 구조, 시각적 다양성을 먼저 학습하는 확장 경로를 제시한다. 실제 로봇 데이터는 이후 실행 가능성 확인과 특정 하드웨어에 맞춘 조정에 집중할 수 있다.

다만 영상에서 추론한 관측과 행동의 품질은 여전히 중요하며, 로봇 형태가 달라지면 추가적인 적응이 필요할 수 있다. 따라서 HuRo는 실제 로봇 데이터를 완전히 대체하기보다 보완하는 사전학습 자원으로 보는 편이 타당하다. 관측과 행동을 함께 정렬하면 인간 영상도 대규모 VLA 학습에 활용할 수 있는 로봇 경험으로 바뀔 수 있다는 점이 이 연구의 핵심 시사점이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
CARE, VLA 로봇이 실행 실패에서 스스로 복구하도록 돕다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

CARE, VLA 로봇이 실행 실패에서 스스로 복구하도록 돕다

CARE는 로봇 조작 중 계획된 궤적에서 벗어났을 때 회복할 수 있도록 설계된 데이터 중심 프레임워크입니다. 실제 실패 롤아웃에서 단계별 편차를 학습하고, 국소적인 수정이나 재작업으로 작업 진행을 보존합니다.

더 보기
CCTest · Blog
Grounded Action Model, 3D 그라운딩을 로봇 제어의 기반으로
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

Grounded Action Model, 3D 그라운딩을 로봇 제어의 기반으로

Grounded Action Model(GAM)은 로봇이 조작해야 할 물체와 그 위치를 명시적으로 이해하도록 설계된 행동 모델입니다. 언어·점·박스 프롬프트를 물체 중심의 3D 표현으로 통합해 장면 변화와 목표물 이동에 대한 대응력을 높입니다.

더 보기
CCTest · Blog
RoboDawn, 비전언어모델의 추론을 로봇 제어로 옮기다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

RoboDawn, 비전언어모델의 추론을 로봇 제어로 옮기다

RoboDawn은 이동, 회전, 그리퍼 조작을 간결한 이산 명령으로 구성해 에이전트형 비전언어모델이 로봇을 제어하도록 한다. 폐루프 상호작용과 소수의 시연만으로 시뮬레이션과 실제 로봇 작업에서 성능 향상을 확인했다.

더 보기