세계 모델처럼 생각하고 VLA 속도로 움직이는 로봇 정책
배경
비전·언어·행동(VLA) 모델은 카메라 관측과 작업 지시를 로봇 행동으로 직접 변환한다. 그러나 일반적인 VLA 학습은 다음에 어떤 행동을 해야 하는지에 집중하며, 그 행동이 환경을 어떻게 바꾸는지는 명시적으로 학습하지 않는 경우가 많다. 따라서 예측의 견고성은 학습 데이터가 다양한 상황을 얼마나 포함하는지에 크게 좌우된다.
세계 모델은 환경의 미래 상태를 예측하면서 물리적 맥락을 더 잘 반영할 수 있다. 하지만 매 의사결정마다 미래를 여러 단계 전개하면 수 초의 계산이 필요할 수 있어 실시간 제어에는 부담이 된다. 논문 ‘Think Like a World Model, Act Like a VLA’는 이 두 기능을 분리하는 방법을 제시한다.
핵심 방법
- 미래 생성 대신 내부 표현을 전달한다. 연구진은 물체, 공간 관계, 장면 변화에 관한 지식이 세계 모델의 중간 특징에 담겨 있다고 본다. 미래 프레임 생성은 이런 표현을 학습하게 만든 목적이지만, 배포된 정책이 반드시 유지해야 할 기능은 아니라는 설명이다.
- 특징 정렬 손실을 추가한다. 동결된 세계 모델을 학습 프레임에 한 번 실행하고 결과 특징을 저장한다. VLA 학생 모델은 기존 행동 학습과 함께 이 캐시된 표현을 모방하도록 훈련된다.
- 학습 후 교사 구성요소를 제거한다. 교사 모델은 학습 중 계속 로드되지 않으며, 정렬에 사용한 프로젝터도 학습 종료 후 버린다. 최종 정책의 추론 경로는 증류하지 않은 기준 VLA와 동일하다.
- 배포 시 계산량을 늘리지 않는다. 논문은 소비자용 RTX 5090에서 32밀리초의 실행 시간과 1.86GB의 메모리 사용량을 보고한다.
결과와 의미
0.8B 학생 모델은 LIBERO에서 97.9%를 달성했다. RoboCasa-GR1 휴머노이드 조작 실험에서는 성능이 48.2%에서 50.5%로 상승했다. 같은 학습 목표는 단일 팔과 양팔을 포함한 실제 로봇 플랫폼에도 적용됐다. 학생 모델 규모, 백본, 정렬 계층, 교사 모델을 바꾼 실험에서도 개선이 유지돼 특정 네트워크 조합에만 의존하는 효과는 아닐 가능성을 보여준다.
이 접근은 역할 분담이 분명하다. 세계 모델은 오프라인에서 물리적으로 의미 있는 학습 신호를 제공하고, VLA는 온라인에서 빠르고 작은 행동 정책으로 작동한다. 미래를 반복적으로 생성하지 않으므로 추가 파라미터나 테스트 시 계산이 아니라 표현 품질에 따른 개선인지 판단하기도 쉽다.
다만 현재 제공된 자료는 초록과 프로젝트 요약 중심이다. 전체 학습 비용, 과제별 세부 통계, 실패 사례는 확인되지 않는다. 분포 밖 환경이나 장기 조작에서도 같은 표현 선행지식이 안정적으로 작동하는지는 원문과 추가적인 실제 로봇 실험을 통해 검증해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…