아티클 목록으로
월드 모델

Masked Visual Actions: 비디오 모델을 로봇 세계 모델로 연결하는 방법

약 2분 소요

도입

비디오 모델은 대규모 영상 학습을 통해 물체가 어떻게 움직이고, 접촉하고, 상호작용하는지에 대한 풍부한 시각적 사전 지식을 갖게 된다. 그래서 로봇 세계 모델의 기반으로 주목받지만, 핵심 난점은 행동을 어떤 형식으로 전달하느냐다. 로봇 제어는 보통 관절, 말단 장치, 저수준 명령으로 표현되는 반면, 비디오 모델은 픽셀 공간의 변화에 익숙하다. 논문 “Masked Visual Actions for Unified World Modeling”은 이 간극을 시각적 행동 표현으로 줄이려는 시도다.

핵심 내용

  • 행동을 픽셀 궤적으로 표현: Masked Visual Actions는 영상 속 임의의 개체가 따라가는 궤적을 일부만 드러내는 방식으로 행동을 나타낸다. 숫자형 제어 명령을 직접 주입하기보다, 모델이 이미 학습한 시각 공간과 더 가까운 조건을 제공한다.
  • 하나의 모델로 정방향과 역방향을 처리: 공개된 궤적이 로봇의 움직임이면 모델은 정방향 동역학 모델처럼 작동해 저수준 로봇 행동에 대한 장면 반응을 예측한다. 반대로 원하는 물체 움직임을 드러내면, 그 결과와 일치하는 로봇 행동을 복원하는 역모델 역할을 한다.
  • 상대적으로 적은 미세조정 데이터: 초록에 따르면 실제 영상과 시뮬레이션에서 나온 15시간 분량의 마스크 예제만으로 미세조정했으며, 단일 checkpoint가 다양한 장면과 여러 로봇 embodiment에서 높은 시각적 충실도와 제어성을 달성했다.
  • 조작 과제에서의 활용: 모델이 생성한 상상 rollout의 결과는 실제 실행 결과와 상관관계를 보여 정책 평가에 쓰일 수 있다. 또한 모델 기반 계획에서 후보 미래를 순위화하고, 원하는 물체 움직임으로부터 로봇 움직임을 합성하는 데도 활용된다.

의미와 영향

이 연구의 초점은 새로운 로봇 제어기를 만드는 것보다, 비디오 모델이 이해할 수 있는 행동 언어를 설계하는 데 있다. 행동을 보이는 궤적으로 표현하면, 비디오 모델 내부에 축적된 상호작용 지식을 예측, 계획, 역모델링에 더 자연스럽게 사용할 수 있다. 초록만으로는 긴 시간 범위의 과제나 정밀한 접촉 제어에서의 한계를 판단하기 어렵지만, 비디오 생성 모델을 로봇 의사결정에 연결하는 구체적인 인터페이스를 제시했다는 점에서 의미가 크다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
GE-Act 2.0, 로봇 세계 행동 모델의 사전학습과 확장성 검증
월드 모델
cctest.ai
월드 모델

GE-Act 2.0, 로봇 세계 행동 모델의 사전학습과 확장성 검증

GE-Act 2.0은 사전학습된 비디오 생성기에 의존하지 않고 조작 데이터만으로 세계 행동 모델을 처음부터 학습한다. 연구진은 데이터 규모를 키우면 새로운 환경과 서로 다른 로봇 본체에서 제로샷 조작 성능이 향상될 수 있음을 보였다.

더 보기
CCTest · Blog
WorldSculpt: 단일 객체 3D 생성 사전지식으로 조합 가능한 세계 구축
월드 모델
cctest.ai
월드 모델

WorldSculpt: 단일 객체 3D 생성 사전지식으로 조합 가능한 세계 구축

WorldSculpt는 단일 객체용 3D 생성 사전지식을 자세 추정이 포함된 다중 시점 영상에 적용합니다. 심한 가림이 발생하는 수백 개 객체 규모의 복잡한 장면을 하나의 덩어리가 아닌 개별 메시들의 세계로 재구성하는 것이 목표입니다.

더 보기
CCTest · Blog
세계 모델을 훈련 뒤 빼면 로봇이 더 강해지는 이유
월드 모델
cctest.ai
월드 모델

세계 모델을 훈련 뒤 빼면 로봇이 더 강해지는 이유

광샹테크놀로지와 칭화대 연구진은 세계 모델을 로봇의 실행 단계에는 사용하지 않고, 훈련 중 행동 결과를 평가하는 데만 활용하는 ActEffect를 제안했다. 훈련 때는 많이 생각하고 배치 단계에서는 가볍게 실행하는 방식이다.

더 보기