OpenWAM, 세계-행동 모델 사전학습을 개방형 실험으로 전환
들어가며
세계-행동 모델(World-Action Model, WAM)은 비디오 생성 모델이 학습한 폭넓은 세계 지식을 로봇이 실행할 수 있는 제어 신호로 바꾸는 것을 목표로 한다. 그러나 기존 시스템에서는 생성 백본, 시각 표현, 행동 표현, 정보 흐름, 추론 절차, 학습 데이터가 서로 강하게 결합돼 있다. 이 구조에서는 성능 향상이 어떤 설계 선택에서 비롯됐는지 확인하기 어렵다.
OpenWAM은 새로운 단일 모델을 제시하는 데 그치지 않고, WAM 사전학습을 재현 가능한 통제 실험 프로그램으로 바꾼다. 프로젝트는 OpenWAM-Infra, OpenWAM-Study, OpenWAM-α의 세 부분으로 구성된다.
핵심 내용
- 조합 가능한 인프라. OpenWAM-Infra는 WAM 설계 공간을 모듈로 분해하고 학습, 추론, 배포, 평가를 위한 통합 절차를 제공한다. 8개 시뮬레이션 벤치마크를 대상으로 설계 선택을 비교할 수 있다.
- 세 가지 연구 질문. OpenWAM-Study는 상위 모델에서 어떤 지식을 물려받아야 하는지, 세계 학습과 행동 학습을 어떻게 결합해야 하는지, 그리고 두 학습의 시너지가 규모 확장에 따라 어떻게 변하는지를 다룬다.
- 시너지를 위한 설계 원칙. 상위 지식의 전이를 위해서는 충분한 역량을 가진 생성 백본과 작지만 정보가 풍부한 잠재 공간이 필요하다고 분석한다. 세계와 행동의 결합에는 별도의 행동 용량, 명시적인 세계-행동 정보 경로, 동기화된 공동 디노이징이 요구된다.
- 체화 데이터와 분포 밖 일반화. 체화 사전학습의 주요 효과는 학습 분포를 벗어난 환경에서의 일반화 향상으로 설명된다. 인간 1인칭 데이터와 로봇 데이터를 한 단계에서 함께 학습하면 넓은 세계 범위와 행동 접지를 동시에 확보할 수 있다는 접근이다.
- 공개 기준 모델. OpenWAM-α는 인간과 로봇의 1인칭 데이터 약 6400시간, 약 5억1850만 프레임으로 사전학습됐다. 5개 로봇 형태를 포함한 8개 시뮬레이션 벤치마크에서 상위권 성능을 보였고, 이동형 양팔 벤치마크 EBench에서는 프로젝트가 보고한 최고 성능을 기록했다. 실제 양팔 RoboDojo-Real 리더보드에서는 1위를 차지했으며 성공률은 pi0.5의 약 2배로 보고됐다. 단일 팔과 손가락 조작 로봇에서도 대표적인 WAM 및 VLA 기준선보다 일관된 우위를 보였다고 한다.
의미와 한계
OpenWAM의 핵심 가치는 방법론적이다. 더 큰 모델이나 더 많은 데이터가 효과적인지 묻는 추상적인 논의를, 서로 분리해 검증할 수 있는 실험으로 바꾸기 때문이다. 또한 아키텍처, 데이터, 최적화가 함께 만든 결과를 특정 구성 요소 하나의 효과로 잘못 해석할 가능성을 줄인다.
다만 현재 확인 가능한 자료는 초록과 프로젝트 수준의 결과 요약이 중심이다. 따라서 각 모듈의 구체적인 기여도와 세부 제거 실험을 독립적으로 판단하기에는 한계가 있다. 앞으로는 더 다양한 로봇 형태와 실제 환경, 데이터 규모에서도 제시된 원칙이 유지되는지 검증해야 한다. 공개 코드와 가중치가 재현성을 뒷받침한다면 OpenWAM은 체화 AI에서 세계 지식 전이와 행동 일반화를 연구하는 공통 기준선이 될 가능성이 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…