Masked Visual Actions: 비디오 모델을 로봇 세계 모델로 연결하는 방법
도입
비디오 모델은 대규모 영상 학습을 통해 물체가 어떻게 움직이고, 접촉하고, 상호작용하는지에 대한 풍부한 시각적 사전 지식을 갖게 된다. 그래서 로봇 세계 모델의 기반으로 주목받지만, 핵심 난점은 행동을 어떤 형식으로 전달하느냐다. 로봇 제어는 보통 관절, 말단 장치, 저수준 명령으로 표현되는 반면, 비디오 모델은 픽셀 공간의 변화에 익숙하다. 논문 “Masked Visual Actions for Unified World Modeling”은 이 간극을 시각적 행동 표현으로 줄이려는 시도다.
핵심 내용
- 행동을 픽셀 궤적으로 표현: Masked Visual Actions는 영상 속 임의의 개체가 따라가는 궤적을 일부만 드러내는 방식으로 행동을 나타낸다. 숫자형 제어 명령을 직접 주입하기보다, 모델이 이미 학습한 시각 공간과 더 가까운 조건을 제공한다.
- 하나의 모델로 정방향과 역방향을 처리: 공개된 궤적이 로봇의 움직임이면 모델은 정방향 동역학 모델처럼 작동해 저수준 로봇 행동에 대한 장면 반응을 예측한다. 반대로 원하는 물체 움직임을 드러내면, 그 결과와 일치하는 로봇 행동을 복원하는 역모델 역할을 한다.
- 상대적으로 적은 미세조정 데이터: 초록에 따르면 실제 영상과 시뮬레이션에서 나온 15시간 분량의 마스크 예제만으로 미세조정했으며, 단일 checkpoint가 다양한 장면과 여러 로봇 embodiment에서 높은 시각적 충실도와 제어성을 달성했다.
- 조작 과제에서의 활용: 모델이 생성한 상상 rollout의 결과는 실제 실행 결과와 상관관계를 보여 정책 평가에 쓰일 수 있다. 또한 모델 기반 계획에서 후보 미래를 순위화하고, 원하는 물체 움직임으로부터 로봇 움직임을 합성하는 데도 활용된다.
의미와 영향
이 연구의 초점은 새로운 로봇 제어기를 만드는 것보다, 비디오 모델이 이해할 수 있는 행동 언어를 설계하는 데 있다. 행동을 보이는 궤적으로 표현하면, 비디오 모델 내부에 축적된 상호작용 지식을 예측, 계획, 역모델링에 더 자연스럽게 사용할 수 있다. 초록만으로는 긴 시간 범위의 과제나 정밀한 접촉 제어에서의 한계를 판단하기 어렵지만, 비디오 생성 모델을 로봇 의사결정에 연결하는 구체적인 인터페이스를 제시했다는 점에서 의미가 크다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…