아티클 목록으로
월드 모델

EVO-WAM, 로봇이 스스로 상상한 궤적을 검증하며 학습하게 하다

약 3분 소요

로봇 정책을 새로운 작업에 적용하려면 대개 추가 전문가 시연을 수집하거나 실제 환경에서 여러 번 시행착오를 겪어야 한다. 두 방식 모두 비용과 시간이 많이 들며, 긴 작업일수록 부담이 커진다. 논문 「EVO-WAM: Evolving World Action Models through Video-Action Verification」은 세계 행동 모델이 스스로 생성한 경험을 활용해 이 문제를 완화하는 방법을 제안한다.

생성된 결과를 그대로 믿지 않는 이유

세계 행동 모델, 즉 WAM은 폭넓은 비디오 사전지식을 이용해 미래 영상과 로봇 행동을 함께 예측한다. 따라서 새로운 작업에 필요한 학습 신호를 만들 수 있지만, 생성 경험에는 두 가지 위험이 있다. 영상이 목표 달성을 보여주지 않을 수 있고, 겉보기에는 성공한 영상이라도 연결된 행동이 실제 영상 속 움직임과 맞지 않아 로봇 실행에서 실패할 수 있다.

EVO-WAM은 다음과 같은 검증 절차로 문제를 다룬다.

  • 자기회귀 롤아웃 보강: 상태 예측을 학습에 추가하고 앵커된 다중 프레임 문맥을 사용해, 외부 실행 피드백 없이도 더 완전한 연속 롤아웃을 생성하도록 한다.
  • 작업 완료 구간 선별: 비전언어 모델로 생성 궤적을 분석해 실제로 목표를 달성한 것으로 보이는 프리픽스를 선택한다.
  • 비디오와 행동의 일치성 확인: 역동역학 모델을 이용해 생성 영상의 움직임이 대응 행동과 양립하는지 검사한다.
  • 반복적 자기학습: 검증을 통과한 프리픽스로 WAM을 재학습한 뒤, 개선된 모델로 새로운 궤적을 생성한다.

실험 결과

7개의 미경험 RoboTwin 2.0 작업에서 EVO-WAM은 Cosmos3의 평균 성공률을 26.9%에서 68.0%로 높였다. DreamZero의 평균 성공률도 28.5%에서 46.4%로 상승했다. 이는 각각 초기 성능의 약 2.5배와 1.6배다. 실제 환경의 미경험 장기 복합 작업 3개에서는 Cosmos3의 평균 성공률이 20.0%에서 76.7%로 개선됐다.

의미와 한계

핵심은 합성 궤적을 무조건 많이 만드는 데 있지 않다. EVO-WAM은 생성된 경험을 학습 데이터로 바로 사용하지 않고, 목표 달성 여부와 제어 신호의 일관성을 모두 확인한 뒤 선별한다. 로봇이 모든 후보 행동을 실제로 실행하기 전에 모델 내부에서 가설을 만들고 걸러낼 수 있다는 점이 중요하다.

이 연구는 시각적으로 자연스러운 결과와 실제로 실행 가능한 행동이 서로 다를 수 있다는 점도 보여준다. 앞으로는 더 다양한 환경과 실패 유형, 긴 시간 범위에서도 두 검증기가 안정적으로 작동하는지 확인해야 한다. 그럼에도 EVO-WAM은 세계 모델의 상상 능력을 반복적인 로봇 정책 개선에 연결하는 구체적인 설계 방향을 제시한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Physis-Lang, 진화하는 물리 언어로 비디오 월드 모델 개선
월드 모델
cctest.ai
월드 모델

Physis-Lang, 진화하는 물리 언어로 비디오 월드 모델 개선

NVIDIA 연구진이 객체, 원인, 상호작용, 시간적 변화와 결과를 설명하는 물리 언어를 데이터 정제·모델 학습·비디오 생성의 공통 표현으로 사용하는 Physis-Lang을 제안했습니다. 원자적 주장 평가와 언어 기반 검색을 통해 물리적으로 더 타당한 영상을 생성하는 것이 목표입니다.

더 보기
CCTest · Blog
세계 행동 모델의 일반화를 만드는 것은 미래의 완전한 생성이 아니다
월드 모델
cctest.ai
월드 모델

세계 행동 모델의 일반화를 만드는 것은 미래의 완전한 생성이 아니다

새로운 실증 연구는 세계 행동 모델이 추론 단계에서 미래 영상을 끝까지 생성하지 않아도 일반화 성능의 이점을 유지할 수 있음을 시사한다. 핵심은 행동을 결정하기 전에 미래 표현을 준비하는 과정이다.

더 보기