아티클 목록으로
로보틱스·피지컬 AI

Xiaomi-Robotics-1, 10만 시간 이상의 실제 궤적으로 로봇 VLA 확장

약 3분 소요

도입

로봇 학습은 오랫동안 데이터 부족 문제에 묶여 있었다. 언어와 비전 모델은 웹 규모의 데이터로 빠르게 확장됐지만, 로봇 조작 데이터는 물리적 환경에서 직접 수집해야 하므로 비용이 높고 다양성을 확보하기 어렵다. Xiaomi-Robotics-1은 이 문제에 대해 로봇도 대규모 실제 경험을 통해 확장 효과를 얻을 수 있는지를 실험한 모델이다.

이 모델은 비전, 언어, 행동을 함께 다루는 VLA 기반 모델로 제시됐다. 사전학습에는 UMI 장치로 수집한 10만 시간 이상의 실제 조작 궤적이 사용됐고, 데이터는 가정, 상업 공간, 산업 현장, 야외 환경을 포함한 1700개 이상의 시나리오를 포괄한다. 이후 실제 로봇의 몸체와 인간이 사용하는 자연어 명령에 맞추는 후학습이 진행된다.

핵심 내용

  • 대규모 실제 조작 데이터: 특정 로봇 플랫폼에서만 모은 데이터가 아니라, embodiment-free UMI 조작 궤적을 사용한다. 이를 통해 더 다양한 물체, 환경, 상호작용 패턴을 학습할 수 있다.
  • 자동 언어 주석 파이프라인: 10만 시간 이상의 궤적을 사람이 직접 설명하는 것은 비현실적이다. 연구팀은 긴 궤적을 짧은 클립으로 나눈 뒤, 비전-언어 모델로 그리퍼와 물체의 상태 변화를 설명하게 했다.
  • 두 단계 학습 구조: 사전학습에서는 언어로 표현된 상태 변화에 맞는 행동 생성 능력을 익힌다. 후학습에서는 교차 형태 로봇 데이터와 실제 가정에서 수집한 7200시간 이상의 사내 실제 로봇 데이터를 활용해 모델을 정렬한다.
  • 확장 효과의 전이: 사전학습 데이터나 모델 크기를 늘리면 행동 예측 오류가 줄어드는 경향이 보고됐다. 더 강한 사전학습 모델은 정렬 이후 실제 로봇의 제로샷 성능도 더 높였으며, 뚜렷한 포화는 관찰되지 않았다고 설명된다.
  • 새 작업에 대한 높은 데이터 효율: 전화기 포장, 프린터 보충, 세탁물 넣기, 박스 포장 등 네 가지 실제 작업에서 작업당 평균 10시간 미만의 데모만으로 전체 성공률 75%를 달성했다. 같은 데이터 조건에서 π0.5는 40%로 제시됐다. 작업당 평균 40시간 미만으로 늘리면 성공률은 85%에 도달한다.
  • 시뮬레이션 벤치마크 성과: RoboCasa 74.5%, RoboCasa365 57.4%, VLABench 59.1%, RoboDojo 13.93%의 평균 성공률을 보고했으며, 소재에서는 네 벤치마크 모두에서 최고 보고 성능이라고 설명한다.

의미와 영향

Xiaomi-Robotics-1의 핵심 의미는 로봇 기초 모델의 발전 축을 데이터 규모와 자동 주석으로 확장했다는 점이다. 특정 로봇과 제한된 실험실 환경에 묶인 소규모 데모만으로는 범용성을 확보하기 어렵다. 반면 이 접근은 다양한 실제 조작 경험을 언어 조건 학습 데이터로 바꾸어 더 넓은 기반 정책을 만들 수 있음을 보여준다.

물론 이것이 범용 가정용 로봇의 완성을 뜻하지는 않는다. 실제 배치에는 안전성, 장기 계획, 실패 복구, 하드웨어 신뢰성, 평가 환경과 현실 세계의 차이 같은 문제가 여전히 남아 있다. 이번 결과는 모든 문제의 해결이 아니라, 규모를 키울수록 성능이 개선되는 유망한 방향을 보여준 것이다.

그럼에도 이 연구는 중요한 신호다. 로봇 분야의 다음 진전은 더 나은 하드웨어뿐 아니라, 대규모로 수집되고 자동으로 설명되며 여러 로봇 형태로 이전 가능한 실제 상호작용 데이터에서 나올 가능성이 커지고 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Robot-Centric Pointmaps: VLA가 로봇 좌표계로 세상을 보게 하다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

Robot-Centric Pointmaps: VLA가 로봇 좌표계로 세상을 보게 하다

KAIST AI의 연구는 VLA 모델에서 카메라 관측 좌표계와 로봇 행동 좌표계가 어긋나는 문제를 다룬다. Robot-centric pointmaps는 각 픽셀에 로봇 좌표계 기준 3D 위치를 담아 기존 2D VLA에 비교적 쉽게 결합할 수 있는 표현이다.

더 보기
CCTest · Blog
젠슨 황의 도쿄 방문 이후, 엔비디아가 노리는 일본 ‘피지컬 AI’
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

젠슨 황의 도쿄 방문 이후, 엔비디아가 노리는 일본 ‘피지컬 AI’

젠슨 황의 이틀간 도쿄 방문은 일본의 컴퓨팅 인프라, 로봇, 자동차, 반도체 공급망을 하나의 전략으로 묶었다. 엔비디아는 일본 제조 현장의 차세대 AI 기반을 선점하려 하고 있다.

더 보기