아티클 목록으로
월드 모델

OpenWAM, 세계-행동 모델 사전학습을 개방형 실험으로 전환

약 3분 소요

들어가며

세계-행동 모델(World-Action Model, WAM)은 비디오 생성 모델이 학습한 폭넓은 세계 지식을 로봇이 실행할 수 있는 제어 신호로 바꾸는 것을 목표로 한다. 그러나 기존 시스템에서는 생성 백본, 시각 표현, 행동 표현, 정보 흐름, 추론 절차, 학습 데이터가 서로 강하게 결합돼 있다. 이 구조에서는 성능 향상이 어떤 설계 선택에서 비롯됐는지 확인하기 어렵다.

OpenWAM은 새로운 단일 모델을 제시하는 데 그치지 않고, WAM 사전학습을 재현 가능한 통제 실험 프로그램으로 바꾼다. 프로젝트는 OpenWAM-Infra, OpenWAM-Study, OpenWAM-α의 세 부분으로 구성된다.

핵심 내용

  • 조합 가능한 인프라. OpenWAM-Infra는 WAM 설계 공간을 모듈로 분해하고 학습, 추론, 배포, 평가를 위한 통합 절차를 제공한다. 8개 시뮬레이션 벤치마크를 대상으로 설계 선택을 비교할 수 있다.
  • 세 가지 연구 질문. OpenWAM-Study는 상위 모델에서 어떤 지식을 물려받아야 하는지, 세계 학습과 행동 학습을 어떻게 결합해야 하는지, 그리고 두 학습의 시너지가 규모 확장에 따라 어떻게 변하는지를 다룬다.
  • 시너지를 위한 설계 원칙. 상위 지식의 전이를 위해서는 충분한 역량을 가진 생성 백본과 작지만 정보가 풍부한 잠재 공간이 필요하다고 분석한다. 세계와 행동의 결합에는 별도의 행동 용량, 명시적인 세계-행동 정보 경로, 동기화된 공동 디노이징이 요구된다.
  • 체화 데이터와 분포 밖 일반화. 체화 사전학습의 주요 효과는 학습 분포를 벗어난 환경에서의 일반화 향상으로 설명된다. 인간 1인칭 데이터와 로봇 데이터를 한 단계에서 함께 학습하면 넓은 세계 범위와 행동 접지를 동시에 확보할 수 있다는 접근이다.
  • 공개 기준 모델. OpenWAM-α는 인간과 로봇의 1인칭 데이터 약 6400시간, 약 5억1850만 프레임으로 사전학습됐다. 5개 로봇 형태를 포함한 8개 시뮬레이션 벤치마크에서 상위권 성능을 보였고, 이동형 양팔 벤치마크 EBench에서는 프로젝트가 보고한 최고 성능을 기록했다. 실제 양팔 RoboDojo-Real 리더보드에서는 1위를 차지했으며 성공률은 pi0.5의 약 2배로 보고됐다. 단일 팔과 손가락 조작 로봇에서도 대표적인 WAM 및 VLA 기준선보다 일관된 우위를 보였다고 한다.

의미와 한계

OpenWAM의 핵심 가치는 방법론적이다. 더 큰 모델이나 더 많은 데이터가 효과적인지 묻는 추상적인 논의를, 서로 분리해 검증할 수 있는 실험으로 바꾸기 때문이다. 또한 아키텍처, 데이터, 최적화가 함께 만든 결과를 특정 구성 요소 하나의 효과로 잘못 해석할 가능성을 줄인다.

다만 현재 확인 가능한 자료는 초록과 프로젝트 수준의 결과 요약이 중심이다. 따라서 각 모듈의 구체적인 기여도와 세부 제거 실험을 독립적으로 판단하기에는 한계가 있다. 앞으로는 더 다양한 로봇 형태와 실제 환경, 데이터 규모에서도 제시된 원칙이 유지되는지 검증해야 한다. 공개 코드와 가중치가 재현성을 뒷받침한다면 OpenWAM은 체화 AI에서 세계 지식 전이와 행동 일반화를 연구하는 공통 기준선이 될 가능성이 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
프로그래머블 월드 모델, 영상 생성에 지속적인 상태와 규칙을 부여하다
월드 모델
cctest.ai
월드 모델

프로그래머블 월드 모델, 영상 생성에 지속적인 상태와 규칙을 부여하다

Programmable World Model은 장기 상호작용에서 세계 상태와 규칙을 안정적으로 유지하기 어려운 기존 인터랙티브 영상 모델의 한계를 겨냥한다. 세계의 상태 변화는 실행 가능한 프로그램이 관리하고, 영상 모델은 시각적 표현을 담당한다.

더 보기
CCTest · Blog
GE-Act 2.0, 로봇 세계 행동 모델의 사전학습과 확장성 검증
월드 모델
cctest.ai
월드 모델

GE-Act 2.0, 로봇 세계 행동 모델의 사전학습과 확장성 검증

GE-Act 2.0은 사전학습된 비디오 생성기에 의존하지 않고 조작 데이터만으로 세계 행동 모델을 처음부터 학습한다. 연구진은 데이터 규모를 키우면 새로운 환경과 서로 다른 로봇 본체에서 제로샷 조작 성능이 향상될 수 있음을 보였다.

더 보기
CCTest · Blog
WorldSculpt: 단일 객체 3D 생성 사전지식으로 조합 가능한 세계 구축
월드 모델
cctest.ai
월드 모델

WorldSculpt: 단일 객체 3D 생성 사전지식으로 조합 가능한 세계 구축

WorldSculpt는 단일 객체용 3D 생성 사전지식을 자세 추정이 포함된 다중 시점 영상에 적용합니다. 심한 가림이 발생하는 수백 개 객체 규모의 복잡한 장면을 하나의 덩어리가 아닌 개별 메시들의 세계로 재구성하는 것이 목표입니다.

더 보기