아티클 목록으로
로보틱스·피지컬 AI

N_0-VTLA: 로봇 기초 모델에 촉각 피드백을 더하다

약 3분 소요

도입

최근 로봇 정책 모델은 시각, 언어, 행동을 결합하며 빠르게 발전해 왔습니다. 하지만 실제 조작에서는 카메라만으로 부족한 상황이 많습니다. 물체가 미끄러지는지, 접촉이 충분한지, 힘을 더 주거나 줄여야 하는지와 같은 정보는 촉각 피드백을 통해 더 직접적으로 얻을 수 있습니다. N_0-VTLA는 이러한 한계를 겨냥해 시각, 촉각, 언어, 행동을 하나의 로봇 기초 모델 안에서 다루려는 연구입니다.

핵심 내용

  • VLA에서 VTLA로 확장: N_0-VTLA는 기존 시각 기반 로봇 백본 위에 촉각 인식을 결합합니다. 이를 통해 접촉이 많은 조작에서 더 세밀한 제어를 가능하게 하는 것이 목표입니다.
  • 대규모 시각-촉각 사전학습: 모델은 NeoData라는 대규모 시각-촉각 로봇 데이터셋으로 사전학습됩니다. 저자들은 N_0-VTLA가 규모 있는 촉각 데이터로 사전학습된 첫 VTLA 모델이라고 설명합니다.
  • 단계적 촉각 경로 통합: 후속 학습 단계에서는 예측형 촉각 경로를 추가합니다. 이 경로는 사전학습에서 얻은 접촉 패턴을 하위 조작 과제에 필요한 미세한 움직임 조정으로 연결하는 역할을 합니다.
  • ALTER 기반 오프라인 개선: ALTER는 advantage-conditioned offline reinforcement learning 방법입니다. 상대적 진행 정도와 궤적 이벤트 비교를 이진 advantage 라벨로 바꿔, 이미 수집된 배포 데이터만으로도 정책 학습을 계속 개선할 수 있게 합니다.

보고된 성능

논문에 따르면 N_0-VTLA는 접촉 중심 벤치마크에서 강한 성능을 보였습니다. 실제 로봇 NeoReal 9개 과제에서 모두 승리했으며, 20개 과제로 구성된 시뮬레이션 스위트에서는 평균 성공률 63.8%를 기록했습니다. 가장 강한 기준 모델의 44.0%와 비교해 높은 수치입니다. 또한 ALTER로 학습한 정책은 변형 가능한 물체 조작을 포함한 3개 장기 실제 로봇 과제에서 75%에서 95%의 성공률을 달성했다고 보고됩니다.

의미와 영향

이 연구의 의미는 단순히 센서를 하나 더 붙인 데 있지 않습니다. 촉각은 로봇이 물리 세계와 상호작용할 때 시각이 놓치기 쉬운 정보를 제공합니다. 특히 잡기, 누르기, 밀기, 변형 물체 다루기처럼 접촉 상태가 성패를 좌우하는 작업에서는 촉각 신호가 안정적인 실행의 핵심이 될 수 있습니다.

또한 ALTER는 실제 배포 데이터 활용 측면에서 중요합니다. 로봇 데이터 수집은 비용이 높고, 실패나 부분 성공 궤적에도 학습 가능한 단서가 많습니다. 고정된 데이터셋에서 개선 신호를 추출할 수 있다면 접촉 기반 기술의 반복 비용을 낮출 수 있습니다. 아직 더 넓은 검증과 독립 재현이 필요하지만, N_0-VTLA는 차세대 로봇 기초 모델에서 촉각 학습이 중요한 축이 될 수 있음을 보여줍니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PhysBrain 1.5, 인식·행동 생성·미래 예측을 하나로 통합
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

PhysBrain 1.5, 인식·행동 생성·미래 예측을 하나로 통합

PhysBrain 1.5는 비전-언어 모델을 물리 환경 이해, 엔드이펙터 동작 생성, 미래 상태 예측까지 수행하는 체화형 기반 모델로 확장하려는 연구입니다. 논문에 따르면 8B 모델은 28개 체화 이해 벤치마크에서 평균 72.5점을 기록했습니다.

더 보기
CCTest · Blog
범용 에이전트가 로봇을 직접 조종하는 Agent as Policy
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

범용 에이전트가 로봇을 직접 조종하는 Agent as Policy

Agent as Policy는 범용 코딩 에이전트를 실제 로봇에 연결해 시각 정보를 해석하고 실행 가능한 프로그램과 동작 명령을 생성하도록 합니다. 로봇의 실제 결과를 다시 관찰해 다음 행동을 수정하는 방식으로, 작업별 전용 학습 없이 조작을 수행하는 가능성을 보여줍니다.

더 보기