아티클 목록으로
월드 모델

Pelican-Sim 1.0, 로봇을 위한 범용 월드 모델 시뮬레이터

약 3분 소요

들어가며

로봇이 실제 환경에서 학습하려면 많은 상호작용 데이터가 필요합니다. 그러나 실제 로봇을 반복적으로 시행착오에 투입하면 비용과 시간이 커지고, 실패에 따른 위험도 발생합니다. 현재의 시각 상태와 로봇 행동을 입력으로 받아 다음 관측을 예측하는 월드 모델은 이러한 문제를 보완할 수 있는 핵심 기술로 주목받고 있습니다. Pelican-Sim 1.0은 다양한 로봇 형태와 장면, 작업에 적용할 수 있는 범용 시뮬레이터를 지향합니다.

핵심 설계

첫 번째 특징은 행동 표현의 통합입니다. Pelican-Sim은 여러 주요 로봇 형태의 제어 신호를 28차원 행동값 공간으로 매핑합니다. 이에 따라 로봇별로 별도 모델과 인터페이스를 구축하지 않고 하나의 모델로 이기종 장치를 다룰 수 있습니다. 다만 로봇의 구조와 제어 방식이 달라지면 동역학도 달라지므로, 모델은 이러한 차이를 함께 학습해야 합니다.

두 번째는 행동-시각 정보 주입 방식입니다. 행동 벡터를 시각 특징에 단순히 이어 붙이는 대신, URDF와 카메라 렌더링을 이용해 행동이 반영된 영상을 만듭니다. 이 영상은 제어 명령이 로봇과 물체, 장면의 픽셀 변화로 어떻게 이어지는지 보여주는 연결 고리 역할을 합니다. 제공된 자료에 따르면 이 방식은 대안적 융합 기준선보다 PSNR을 0.904 높였습니다.

세 번째는 희소 혼합 전문가(MoE) 구조입니다. 로봇, 환경, 작업마다 서로 다른 동역학이 나타나기 때문에 선택된 전문가만 계산에 참여하는 구조는 이질적인 행동을 처리할 추가 용량을 제공합니다. 또한 행동 모달리티를 모델에 흡수하면서 시각 정보와 제어 정보 사이의 충돌을 줄입니다. 밀집 백본과 비교했을 때 FVD는 6.530 낮아졌습니다.

네 번째는 롤아웃 생성 효율화입니다. 인과적 적응과 소수 단계 증류를 적용해 기존 35단계 생성 과정을 4단계 자기회귀 시뮬레이터로 바꾸고, 5.67배의 속도 향상을 얻었습니다. 계획 수립과 정책 탐색, 합성 데이터 생성에는 많은 가상 시도가 필요하므로, 빠른 롤아웃은 실용성과 직접 연결됩니다.

실험 결과와 영향

Pelican-Sim은 약 100만 개의 실제 및 시뮬레이션 궤적으로 학습됐습니다. 평가된 가장 강한 기준선과 비교하면 PSNR은 AgiBotWorld Beta에서 4.636, RoboMIND에서 2.080, RoboTwin에서 10.343 개선됐습니다. RoboTwin에서는 조정된 EWMBench DYN 점수도 0.426 상승했습니다.

효과는 영상 예측 지표에만 머물지 않았습니다. RoboTwin 실험에서 작업별 시연 데이터 50개에 생성 궤적 500개를 추가하자 정책 성공률이 70%에서 93%로 높아졌습니다. 다섯 개 체크포인트에 대한 정책 평가의 Pearson 상관계수는 0.994였고, 행동 선택과 정책 개선의 상대적 성공률 향상은 각각 47.7%와 20.3%로 보고됐습니다.

Pelican-Sim의 의미는 월드 모델을 단순한 영상 생성기가 아니라 행동 결과를 예측하고 의사결정을 지원하는 시뮬레이터로 확장했다는 데 있습니다. 통합 행동 인터페이스는 로봇 간 데이터 재사용 가능성을 높이고, 렌더링된 행동 영상은 제어 명령과 시각적 결과를 정렬하는 실용적인 방법을 제공합니다.

다만 제공된 자료만으로는 장기 계획, 실제 배치에서의 분포 변화, 미지의 로봇 구조, 안전한 폐루프 제어에 대한 안정성을 판단하기 어렵습니다. 향후에는 예측 품질이 실제 로봇의 지속적이고 신뢰할 수 있는 제어 성능으로 이어지는지 추가 검증이 필요합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
한 장의 이미지에서 실행 가능한 세계로: RCWM의 재귀적 3D 장면 구축
월드 모델
cctest.ai
월드 모델

한 장의 이미지에서 실행 가능한 세계로: RCWM의 재귀적 3D 장면 구축

Recursive Code World Models(RCWM)는 단일 참조 이미지에서 복잡한 3D 세계를 실행 가능한 코드로 재구성하는 프레임워크입니다. 전체·부분·전체의 재귀 루프를 통해 세부를 다듬으면서도 장면 전체의 공간 관계를 유지합니다.

더 보기
CCTest · Blog
World in World, 동결된 비디오 월드 모델에 유연한 제어를 더하다
월드 모델
cctest.ai
월드 모델

World in World, 동결된 비디오 월드 모델에 유연한 제어를 더하다

World in World는 비디오 월드 모델을 다시 학습하지 않고도 여러 시각적 증거를 추론 단계에서 통합하는 인터페이스를 제안한다. 시점 변경, 장기 재방문, 인간 동작 전이를 하나의 구조로 지원하는 것이 목표다.

더 보기