ProWAM, 점진적 시각 하위 목표로 로봇 장기 제어 강화
로봇이 물체를 집어 목표 위치에 놓는 작업을 수행하려면 다음 행동만 선택해서는 부족하다. 성공에 이르기까지 어떤 중간 상태를 거쳐야 하는지도 판단해야 한다. 세계 행동 모델(World Action Models, WAMs)은 초기 관측과 지시를 바탕으로 미래의 시각 변화와 행동을 함께 예측하며 이 문제에 접근한다. 그러나 시간 범위가 길어지면 미래 영상을 촘촘하게 생성하는 방식은 계산량이 크고, 여러 단계에서 예측 오차가 누적될 수 있다.
전체 영상 대신 시각적 이정표를 예측
논문은 ProWAM(Progressive World Action Model)을 제안한다. ProWAM은 미래를 프레임 단위의 완전한 영상으로 상상하는 대신, 실행 순서가 정해진 희소 시각 하위 목표를 예측한다. 이 하위 목표는 작업 진행을 알려주는 시각적 이정표처럼 작동한다. 모델은 먼저 도달해야 할 주요 중간 상태를 계획하고, 이를 바탕으로 각 단계의 행동을 생성한다.
이 방식은 미래 프레임 한 장만 예측하는 접근법의 한계도 보완한다. 최종 프레임은 성공 상태가 어떻게 보이는지는 알려주지만, 로봇이 그 상태에 어떻게 도달해야 하는지는 충분히 설명하지 못한다. 순서가 있는 하위 목표는 현재 관측과 최종 지시 사이에 단계적인 경로를 제공해, 행동 정책이 중간의 시각적 근거를 활용하도록 한다.
핵심 설계
- 행동과 하위 목표의 공동 예측: 로봇이 무엇을 할지와 다음에 무엇을 보게 될지를 함께 모델링해 계획과 제어를 연결한다.
- 희소한 미래 표현: 조밀한 영상 대신 작업에 중요한 시각 상태만 유지해 장기 미래 상상의 비용을 줄인다.
- 특징 캐싱: 비디오 백본을 한 번만 순전파해 하위 목표 특징을 저장한다. 재계획에서는 전체 영상을 반복 생성하지 않고 가벼운 행동 디노이징을 수행한다.
- 행동 라벨이 없는 영상 활용: 하위 목표 예측은 대규모 액션 프리 영상으로 학습할 수 있다. 이에 따라 복잡한 시각 계획을 비디오 백본이 분담하고, 행동 정책은 제어에 집중할 수 있다.
결과와 의미
논문이 보고한 평가에서 ProWAM은 LIBERO-Plus에서 85.8%, 랜덤화 RoboTwin에서 75.7%의 성공률을 기록했다. RoboCasa365에서는 전체 성공률 48.1%, 난도가 높은 Composite-Unseen 분할에서 18.2%를 달성했다. 또한 가장 강한 기준선과 비교해 최대 35.9%의 상대적 향상이 보고됐다. 이는 희소한 점진적 시각 안내가 미래 생성 비용을 낮추는 동시에 훈련 분포 밖의 제어에도 도움을 줄 가능성을 보여준다.
다만 제공된 소재에는 상세한 절제 실험, 하드웨어 구성, 실제 로봇 배치 결과가 포함되어 있지 않다. 따라서 카메라 잡음, 구동 오차, 추론 지연, 물리적 안전 요구가 있는 환경에서 얼마나 안정적으로 작동하는지는 논문 전문과 추가 실험을 통해 확인해야 한다. 제시된 수치는 실제 배치 가능성을 완전히 검증한 결과라기보다, 제안된 모델링 방향을 뒷받침하는 근거로 보는 편이 타당하다.
ProWAM의 broader한 의미는 세계 모델이 미래의 모든 프레임을 생성할 필요는 없다는 데 있다. 의미 있는 시각 상태를 소수의 단계로 구성하면 작업 진행 정보를 전달하면서 반복적인 비디오 합성을 피할 수 있다. 이 아이디어가 실제 환경에서도 유지된다면, 체화 AI는 계획 품질과 추론 비용, 장기 일반화 사이에서 더 나은 균형을 찾을 수 있을 것이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…