EVO-WAM, 로봇이 스스로 상상한 궤적을 검증하며 학습하게 하다
로봇 정책을 새로운 작업에 적용하려면 대개 추가 전문가 시연을 수집하거나 실제 환경에서 여러 번 시행착오를 겪어야 한다. 두 방식 모두 비용과 시간이 많이 들며, 긴 작업일수록 부담이 커진다. 논문 「EVO-WAM: Evolving World Action Models through Video-Action Verification」은 세계 행동 모델이 스스로 생성한 경험을 활용해 이 문제를 완화하는 방법을 제안한다.
생성된 결과를 그대로 믿지 않는 이유
세계 행동 모델, 즉 WAM은 폭넓은 비디오 사전지식을 이용해 미래 영상과 로봇 행동을 함께 예측한다. 따라서 새로운 작업에 필요한 학습 신호를 만들 수 있지만, 생성 경험에는 두 가지 위험이 있다. 영상이 목표 달성을 보여주지 않을 수 있고, 겉보기에는 성공한 영상이라도 연결된 행동이 실제 영상 속 움직임과 맞지 않아 로봇 실행에서 실패할 수 있다.
EVO-WAM은 다음과 같은 검증 절차로 문제를 다룬다.
- 자기회귀 롤아웃 보강: 상태 예측을 학습에 추가하고 앵커된 다중 프레임 문맥을 사용해, 외부 실행 피드백 없이도 더 완전한 연속 롤아웃을 생성하도록 한다.
- 작업 완료 구간 선별: 비전언어 모델로 생성 궤적을 분석해 실제로 목표를 달성한 것으로 보이는 프리픽스를 선택한다.
- 비디오와 행동의 일치성 확인: 역동역학 모델을 이용해 생성 영상의 움직임이 대응 행동과 양립하는지 검사한다.
- 반복적 자기학습: 검증을 통과한 프리픽스로 WAM을 재학습한 뒤, 개선된 모델로 새로운 궤적을 생성한다.
실험 결과
7개의 미경험 RoboTwin 2.0 작업에서 EVO-WAM은 Cosmos3의 평균 성공률을 26.9%에서 68.0%로 높였다. DreamZero의 평균 성공률도 28.5%에서 46.4%로 상승했다. 이는 각각 초기 성능의 약 2.5배와 1.6배다. 실제 환경의 미경험 장기 복합 작업 3개에서는 Cosmos3의 평균 성공률이 20.0%에서 76.7%로 개선됐다.
의미와 한계
핵심은 합성 궤적을 무조건 많이 만드는 데 있지 않다. EVO-WAM은 생성된 경험을 학습 데이터로 바로 사용하지 않고, 목표 달성 여부와 제어 신호의 일관성을 모두 확인한 뒤 선별한다. 로봇이 모든 후보 행동을 실제로 실행하기 전에 모델 내부에서 가설을 만들고 걸러낼 수 있다는 점이 중요하다.
이 연구는 시각적으로 자연스러운 결과와 실제로 실행 가능한 행동이 서로 다를 수 있다는 점도 보여준다. 앞으로는 더 다양한 환경과 실패 유형, 긴 시간 범위에서도 두 검증기가 안정적으로 작동하는지 확인해야 한다. 그럼에도 EVO-WAM은 세계 모델의 상상 능력을 반복적인 로봇 정책 개선에 연결하는 구체적인 설계 방향을 제시한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…