WorldLine, 로봇 행동을 시각 세계에서 먼저 검증하다
들어가며
로봇이 물체를 집거나 밀고 내려놓는 방법을 배우려면 대개 실제 환경에서 수많은 상호작용을 반복해야 한다. 매 시도마다 시간과 장비 가동 시간을 소모하며, 사람의 확인이 필요한 경우도 있다. 반대로 시각 시뮬레이터가 행동을 실행하기 전에 장면의 변화를 예측할 수 있다면, 실제 실행에 앞서 여러 정책과 행동 후보를 비교할 수 있다.
그러나 기존 영상 생성 모델은 행동의 정확한 결과보다 그럴듯한 화면을 만드는 데 치우치기 쉽다. 영상이 자연스러워 보여도 로봇의 지정된 움직임을 제대로 따르지 못하거나, 로봇과 물체 사이의 인과적 상호작용을 일관되게 표현하지 못할 수 있다. 홍콩과학기술대 연구진의 WorldLine은 이 문제를 행동 구동형 시각 시뮬레이션으로 다룬다.
핵심 설계
WorldLine의 중심 아이디어는 두 가지 학습 과제를 분리하는 것이다. 먼저 대규모 로봇 영상에서 특정 로봇에 덜 의존하는 조작 동역학을 학습한다. 이후 각 로봇의 제어 신호가 이 공통 동역학을 어떻게 유도하는지 학습한다. 이를 통해 제어 공간이 서로 다른 로봇의 데이터를 하나의 시뮬레이터에 활용하려는 것이다.
- 행동 정보가 없는 영상 활용. 1만 시간 이상의 로봇 영상에서 로봇의 움직임, 장면 변화, 물체와의 상호작용에 관한 시각적 규칙을 학습한다.
- 행동 궤적을 통한 제어 정렬. 10개가 넘는 로봇 형태에서 얻은 2000시간 이상의 궤적을 사용해 실제 제어와 공통 동역학 모델을 연결한다.
- 이미지 공간 행동 표현. 로봇마다 다른 제어 인터페이스 사이에 공유 가능한 시각적 행동 표현을 둔다.
- 상호작용 중심 학습. 다중 뷰 데이터와 실패 궤적, 관계 정규화를 사용해 단순한 화질이 아니라 로봇-물체 관계를 보존하도록 한다.
- 효율적인 인과 롤아웃. 로봇 움직임에 초점을 맞춘 소단계 증류로 예측에 필요한 계산 단계를 줄이면서 행동 결과에 중요한 움직임을 유지한다.
결과와 의미
유보된 환경과 도메인 밖 설정에서 WorldLine은 시각적 품질과 로봇 움직임의 일치도를 함께 평가했다. 실패 궤적에서 로봇 마스크 IoU는 가장 강한 기준선보다 0.1626 높았다. RoboTwin과 AgiBot에서 궤적 성공 여부를 예측하는 평균 정확도는 74%로, 가장 강한 기준선보다 1%포인트 높았다. 또한 RoboTwin 데이터로 학습하거나 별도 적응을 하지 않은 조건에서도, WorldLine의 롤아웃을 활용하면 정책을 직접 실행하는 경우보다 작업 성공률이 최대 21.4%포인트 향상됐다.
이 연구의 의미는 생성 영상을 단순한 시각 예측 결과가 아니라 정책 평가 도구로 사용한다는 데 있다. 로봇은 실제 행동을 수행하기 전에 여러 후보를 가상 시각 세계에서 비교하고, 실패 가능성이 높은 행동을 걸러낼 수 있다. 동역학 학습과 행동 정렬을 분리한 구조는 서로 다른 로봇 플랫폼의 영상 데이터를 재사용할 가능성도 보여준다.
다만 수치는 논문에서 제시한 벤치마크와 조건에 기반한다. 따라서 현실 환경과 시뮬레이션 사이의 차이가 사라지는 것은 아니며, 실제 배치에는 하드웨어 안전장치와 물리적 검증이 여전히 필요하다. 그럼에도 WorldLine은 값비싼 실세계 시행착오를 줄이고, 정책 선별과 체화 계획을 지원하는 확장 가능한 시각 시뮬레이터의 방향을 제시한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…