VLA-Precision: VLA 로봇의 실세계 온라인 강화학습을 안정화하다
들어가며
시각-언어-행동 모델(VLA)은 로봇이 장면을 이해하고 언어 지시에 맞는 동작을 생성하도록 만드는 핵심 기술로 주목받고 있다. 여러 조작 작업에 대응할 수 있다는 장점이 있지만, 정밀도와 반복성이 중요한 환경에서는 작은 위치 오차나 접촉 오차도 실패로 이어질 수 있다. 특히 화학 실험처럼 힘과 위치를 일정하게 유지해야 하는 작업에서는 시연 데이터만으로 학습한 정책의 한계가 분명하다.
VLA-Precision은 VLA의 후학습에 실세계 온라인 강화학습을 적용하는 방법을 제안한다. 로봇이 시행착오를 통해 스스로 개선할 수 있다는 점은 장점이지만, 두 가지 병목이 생긴다. 가치 신호가 부정확하면 정책이 유용한 행동에서 멀어지는 정책 드리프트가 발생할 수 있다. 또한 대규모 VLA를 반복적으로 실행하면 경험 수집 속도와 샘플 효율이 낮아진다.
핵심 내용
- 비대칭 공동 부트스트래핑. ACoB는 학습 전 과정에서 동일한 신호를 같은 비중으로 사용하지 않는다. 초기에는 사람의 개입으로 유도된 행동 학습에 집중해 정책을 빠르게 개선하고, 이후 자율적으로 수집되는 경험의 품질도 높인다.
- 단계적인 가치 보정. 자율 경험이 쌓이면 긴 궤적의 결과를 평가하는 전역 리턴 전파와, 개별 행동을 세밀하게 비교하는 지역 선호 순위화를 함께 사용한다. 두 신호를 통해 가치 추정을 보정하고 상대적인 행동 우위를 계산한다.
- 참조 정책으로 드리프트 억제. 새 경험을 반영해 정책을 개선하되 참조 정책과의 차이를 제한한다. 이를 통해 사전학습 VLA가 갖고 있던 일반 능력을 유지하면서 온라인 경험을 흡수하려는 것이다.
- 대규모 VLA를 위한 스트리밍 구조. ACoB-Stream은 경험 수집과 정책 업데이트를 폐쇄 루프로 연결한다. 불변 상태를 분리하고 필요한 시점에만 데이터를 스트리밍하는 방식으로 불필요한 계산과 대기 시간을 줄인다. 논문 초록은 처리량과 계산 효율이 최대 10.9배 향상된다고 보고한다.
의미와 한계
이 연구의 중요한 점은 강화학습 알고리즘의 안정성과 로봇 시스템의 처리 효율을 하나의 문제로 다룬다는 데 있다. 실세계 로봇은 데이터 수집에 시간과 장비 비용이 들고, 실패 경험을 무제한으로 확보하기도 어렵다. 불안정한 업데이트는 정책을 빠르게 악화시킬 수 있으며, 느린 학습 루프는 유용한 경험의 축적을 제한한다. 먼저 개입 데이터를 이용해 행동의 기반을 만들고, 이후 자율 데이터를 통해 가치 추정을 점진적으로 조정하는 방식은 실제 배치 조건에 비교적 잘 맞는다.
평가는 네 가지 범주의 고정밀 화학 작업 아홉 개와 네 종류의 로봇 형태를 대상으로 진행됐다. 다만 제공된 자료의 초록은 최종 결과 부분에서 잘려 있어, 정확한 성공률과 각 기준선 대비 성능 차이는 확인할 수 없다. 따라서 이 자료만으로 특정 방법보다 우수하다고 단정해서는 안 된다.
향후에는 긴 시간 범위의 작업에서도 가치 보정이 안정적으로 작동하는지, 사람의 개입이 얼마나 필요한지, 그리고 10.9배의 효율 향상이 서로 다른 하드웨어에서도 재현되는지를 살펴볼 필요가 있다. VLA를 폭넓은 조작 모델에서 반복 가능한 정밀 조작 모델로 발전시키기 위한 실용적인 학습 프레임워크라는 점에서 의미가 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…