아티클 목록으로
월드 모델

InternW0-Δ, 2만 시간 이상 공개 데이터로 시각 예측과 로봇 행동 통합

약 3분 소요

들어가며

개방된 환경에서 로봇이 물체를 집고 옮기고 정리하려면 현재 화면에 단순히 반응하는 것만으로는 부족합니다. 자신의 행동이 장면을 어떻게 바꿀지, 그리고 어떤 시각적 변화가 다음 행동에 중요한지를 예측해야 합니다. InternW0-Δ는 이러한 문제를 겨냥해 시각적 세계 예측과 로봇 행동 생성을 하나의 World Action Model(WAM)로 통합한 연구입니다.

핵심 내용

  • 여러 사전 지식을 하나의 구조에 결합. Mixture-of-Transformers 프레임워크 안에서 사전 학습된 시각 동역학, 장면 수준 의미 정보, 4D 기하·운동 사전 지식, 행동 생성을 함께 사용합니다. 비디오 전문가는 시각 변화를 모델링하고, 행동 전문가는 제어 행동을 생성하며, 동결된 비전·언어 모델은 의미적 안내를 제공합니다.
  • 추론 단계의 미래 영상 생성을 줄임. Causal Imprint는 학습 시 미래 관측을 활용해 이후 행동과 관련된 장면 변화를 학습합니다. 추론할 때는 이 예측 표현을 행동 전문가에 직접 전달하므로, 행동을 결정하기 전에 미래 비디오를 반복적으로 생성할 필요가 없습니다.
  • 서로 다른 데이터 소스를 공통 표현으로 정렬. 연구진은 로봇 시연, UMI 데이터, 인간의 1인칭 시연, Ego2Robot 데이터를 공통 상태·행동 표현으로 정리했습니다. 논문에 따르면 처리된 학습 코퍼스는 2만 시간을 넘으며, 같은 종류의 오픈소스 코퍼스 중 가장 큰 규모입니다.
  • 시뮬레이션과 실제 로봇을 모두 평가. 저자들은 여러 시뮬레이션 벤치마크와 실제 로봇 플랫폼에서 기존 방법보다 강한 성능을 보였다고 설명합니다. 다만 제공된 자료에는 구체적인 성공률, 하드웨어 구성, 비교 대상의 상세 정보가 없어 전체 논문의 실험 결과를 함께 확인할 필요가 있습니다.

의미와 영향

InternW0-Δ의 핵심적인 시도는 세계 모델과 제어 정책 사이의 간극을 좁히는 것입니다. 시각 동역학 모델은 세계가 어떻게 변하는지 설명할 수 있지만 다음에 어떤 행동을 해야 하는지 직접 결정하지 못할 수 있습니다. 반대로 행동 정책은 제어 신호를 출력하면서도 행동의 미래 결과를 충분히 표현하지 못할 수 있습니다. 이 연구는 두 기능을 동일한 프레임워크에서 상호작용시키고, 의미·기하 정보를 이용해 지각과 조작을 연결하려 합니다.

Causal Imprint는 실용적인 절충도 보여줍니다. 학습 단계에서는 미래 정보를 표현 학습에 활용하지만, 실제 추론에서는 미래 프레임을 계속 합성한 뒤 행동할 필요를 없앱니다. 이 방식은 온라인 제어 경로를 단순화할 가능성이 있지만, 가림 현상, 데이터 분포 변화, 장기 작업에서의 안정성은 추가 검증이 필요한 부분입니다.

훈련 코드, 모델 가중치, 인프라, 데이터 처리 파이프라인, 그리고 라이선스가 허용하는 처리 데이터가 계획대로 공개된다면 재현 연구와 데이터 구성 비교에 도움이 될 수 있습니다. 그러나 데이터 규모만으로 일반화가 보장되지는 않습니다. 라벨의 일관성, 로봇 형태의 차이, 실제 배치 비용이 대규모 세계 행동 모델의 실용성을 결정할 주요 변수입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
HappyWorld-Bench, 상호작용 속 세계 모델의 신뢰성을 검증하다
월드 모델
cctest.ai
월드 모델

HappyWorld-Bench, 상호작용 속 세계 모델의 신뢰성을 검증하다

HappyWorld-Bench는 영상·공간·체화 세계 모델을 대상으로 시각적 품질을 넘어 탐색, 행동, 편집 이후에도 상태가 일관되게 유지되는지를 평가합니다. 장기 롤아웃, 장면 수정, 다단계 행동에서 현재 시스템의 신뢰성 한계를 보여줍니다.

더 보기