N_0-VTLA: 로봇 기초 모델에 촉각 피드백을 더하다
도입
최근 로봇 정책 모델은 시각, 언어, 행동을 결합하며 빠르게 발전해 왔습니다. 하지만 실제 조작에서는 카메라만으로 부족한 상황이 많습니다. 물체가 미끄러지는지, 접촉이 충분한지, 힘을 더 주거나 줄여야 하는지와 같은 정보는 촉각 피드백을 통해 더 직접적으로 얻을 수 있습니다. N_0-VTLA는 이러한 한계를 겨냥해 시각, 촉각, 언어, 행동을 하나의 로봇 기초 모델 안에서 다루려는 연구입니다.
핵심 내용
- VLA에서 VTLA로 확장: N_0-VTLA는 기존 시각 기반 로봇 백본 위에 촉각 인식을 결합합니다. 이를 통해 접촉이 많은 조작에서 더 세밀한 제어를 가능하게 하는 것이 목표입니다.
- 대규모 시각-촉각 사전학습: 모델은 NeoData라는 대규모 시각-촉각 로봇 데이터셋으로 사전학습됩니다. 저자들은 N_0-VTLA가 규모 있는 촉각 데이터로 사전학습된 첫 VTLA 모델이라고 설명합니다.
- 단계적 촉각 경로 통합: 후속 학습 단계에서는 예측형 촉각 경로를 추가합니다. 이 경로는 사전학습에서 얻은 접촉 패턴을 하위 조작 과제에 필요한 미세한 움직임 조정으로 연결하는 역할을 합니다.
- ALTER 기반 오프라인 개선: ALTER는 advantage-conditioned offline reinforcement learning 방법입니다. 상대적 진행 정도와 궤적 이벤트 비교를 이진 advantage 라벨로 바꿔, 이미 수집된 배포 데이터만으로도 정책 학습을 계속 개선할 수 있게 합니다.
보고된 성능
논문에 따르면 N_0-VTLA는 접촉 중심 벤치마크에서 강한 성능을 보였습니다. 실제 로봇 NeoReal 9개 과제에서 모두 승리했으며, 20개 과제로 구성된 시뮬레이션 스위트에서는 평균 성공률 63.8%를 기록했습니다. 가장 강한 기준 모델의 44.0%와 비교해 높은 수치입니다. 또한 ALTER로 학습한 정책은 변형 가능한 물체 조작을 포함한 3개 장기 실제 로봇 과제에서 75%에서 95%의 성공률을 달성했다고 보고됩니다.
의미와 영향
이 연구의 의미는 단순히 센서를 하나 더 붙인 데 있지 않습니다. 촉각은 로봇이 물리 세계와 상호작용할 때 시각이 놓치기 쉬운 정보를 제공합니다. 특히 잡기, 누르기, 밀기, 변형 물체 다루기처럼 접촉 상태가 성패를 좌우하는 작업에서는 촉각 신호가 안정적인 실행의 핵심이 될 수 있습니다.
또한 ALTER는 실제 배포 데이터 활용 측면에서 중요합니다. 로봇 데이터 수집은 비용이 높고, 실패나 부분 성공 궤적에도 학습 가능한 단서가 많습니다. 고정된 데이터셋에서 개선 신호를 추출할 수 있다면 접촉 기반 기술의 반복 비용을 낮출 수 있습니다. 아직 더 넓은 검증과 독립 재현이 필요하지만, N_0-VTLA는 차세대 로봇 기초 모델에서 촉각 학습이 중요한 축이 될 수 있음을 보여줍니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…