아티클 목록으로
로보틱스·피지컬 AI

세계 모델처럼 생각하고 VLA 속도로 움직이는 로봇 정책

약 3분 소요

배경

비전·언어·행동(VLA) 모델은 카메라 관측과 작업 지시를 로봇 행동으로 직접 변환한다. 그러나 일반적인 VLA 학습은 다음에 어떤 행동을 해야 하는지에 집중하며, 그 행동이 환경을 어떻게 바꾸는지는 명시적으로 학습하지 않는 경우가 많다. 따라서 예측의 견고성은 학습 데이터가 다양한 상황을 얼마나 포함하는지에 크게 좌우된다.

세계 모델은 환경의 미래 상태를 예측하면서 물리적 맥락을 더 잘 반영할 수 있다. 하지만 매 의사결정마다 미래를 여러 단계 전개하면 수 초의 계산이 필요할 수 있어 실시간 제어에는 부담이 된다. 논문 ‘Think Like a World Model, Act Like a VLA’는 이 두 기능을 분리하는 방법을 제시한다.

핵심 방법

  • 미래 생성 대신 내부 표현을 전달한다. 연구진은 물체, 공간 관계, 장면 변화에 관한 지식이 세계 모델의 중간 특징에 담겨 있다고 본다. 미래 프레임 생성은 이런 표현을 학습하게 만든 목적이지만, 배포된 정책이 반드시 유지해야 할 기능은 아니라는 설명이다.
  • 특징 정렬 손실을 추가한다. 동결된 세계 모델을 학습 프레임에 한 번 실행하고 결과 특징을 저장한다. VLA 학생 모델은 기존 행동 학습과 함께 이 캐시된 표현을 모방하도록 훈련된다.
  • 학습 후 교사 구성요소를 제거한다. 교사 모델은 학습 중 계속 로드되지 않으며, 정렬에 사용한 프로젝터도 학습 종료 후 버린다. 최종 정책의 추론 경로는 증류하지 않은 기준 VLA와 동일하다.
  • 배포 시 계산량을 늘리지 않는다. 논문은 소비자용 RTX 5090에서 32밀리초의 실행 시간과 1.86GB의 메모리 사용량을 보고한다.

결과와 의미

0.8B 학생 모델은 LIBERO에서 97.9%를 달성했다. RoboCasa-GR1 휴머노이드 조작 실험에서는 성능이 48.2%에서 50.5%로 상승했다. 같은 학습 목표는 단일 팔과 양팔을 포함한 실제 로봇 플랫폼에도 적용됐다. 학생 모델 규모, 백본, 정렬 계층, 교사 모델을 바꾼 실험에서도 개선이 유지돼 특정 네트워크 조합에만 의존하는 효과는 아닐 가능성을 보여준다.

이 접근은 역할 분담이 분명하다. 세계 모델은 오프라인에서 물리적으로 의미 있는 학습 신호를 제공하고, VLA는 온라인에서 빠르고 작은 행동 정책으로 작동한다. 미래를 반복적으로 생성하지 않으므로 추가 파라미터나 테스트 시 계산이 아니라 표현 품질에 따른 개선인지 판단하기도 쉽다.

다만 현재 제공된 자료는 초록과 프로젝트 요약 중심이다. 전체 학습 비용, 과제별 세부 통계, 실패 사례는 확인되지 않는다. 분포 밖 환경이나 장기 조작에서도 같은 표현 선행지식이 안정적으로 작동하는지는 원문과 추가적인 실제 로봇 실험을 통해 검증해야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
RoboDawn, 비전언어모델의 추론을 로봇 제어로 옮기다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

RoboDawn, 비전언어모델의 추론을 로봇 제어로 옮기다

RoboDawn은 이동, 회전, 그리퍼 조작을 간결한 이산 명령으로 구성해 에이전트형 비전언어모델이 로봇을 제어하도록 한다. 폐루프 상호작용과 소수의 시연만으로 시뮬레이션과 실제 로봇 작업에서 성능 향상을 확인했다.

더 보기
CCTest · Blog
Grounded Action Model, 3D 그라운딩을 로봇 제어의 기반으로
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

Grounded Action Model, 3D 그라운딩을 로봇 제어의 기반으로

Grounded Action Model(GAM)은 로봇이 조작해야 할 물체와 그 위치를 명시적으로 이해하도록 설계된 행동 모델입니다. 언어·점·박스 프롬프트를 물체 중심의 3D 표현으로 통합해 장면 변화와 목표물 이동에 대한 대응력을 높입니다.

더 보기
CCTest · Blog
명시적 궤적 없이 앞을 내다보는 3D 확산 정책
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

명시적 궤적 없이 앞을 내다보는 3D 확산 정책

짧은 관측 이력에서 상호작용의 진행 방향을 나타내는 잠재 표현을 학습해 3D 확산 정책에 예측 능력을 더하는 방법이 제안됐다. 별도의 궤적 계획기를 추가하지 않고도 DP3의 기존 구조를 유지하면서 성능 향상을 보고했다.

더 보기