아티클 목록으로
월드 모델

ProWAM, 점진적 시각 하위 목표로 로봇 장기 제어 강화

약 3분 소요

로봇이 물체를 집어 목표 위치에 놓는 작업을 수행하려면 다음 행동만 선택해서는 부족하다. 성공에 이르기까지 어떤 중간 상태를 거쳐야 하는지도 판단해야 한다. 세계 행동 모델(World Action Models, WAMs)은 초기 관측과 지시를 바탕으로 미래의 시각 변화와 행동을 함께 예측하며 이 문제에 접근한다. 그러나 시간 범위가 길어지면 미래 영상을 촘촘하게 생성하는 방식은 계산량이 크고, 여러 단계에서 예측 오차가 누적될 수 있다.

전체 영상 대신 시각적 이정표를 예측

논문은 ProWAM(Progressive World Action Model)을 제안한다. ProWAM은 미래를 프레임 단위의 완전한 영상으로 상상하는 대신, 실행 순서가 정해진 희소 시각 하위 목표를 예측한다. 이 하위 목표는 작업 진행을 알려주는 시각적 이정표처럼 작동한다. 모델은 먼저 도달해야 할 주요 중간 상태를 계획하고, 이를 바탕으로 각 단계의 행동을 생성한다.

이 방식은 미래 프레임 한 장만 예측하는 접근법의 한계도 보완한다. 최종 프레임은 성공 상태가 어떻게 보이는지는 알려주지만, 로봇이 그 상태에 어떻게 도달해야 하는지는 충분히 설명하지 못한다. 순서가 있는 하위 목표는 현재 관측과 최종 지시 사이에 단계적인 경로를 제공해, 행동 정책이 중간의 시각적 근거를 활용하도록 한다.

핵심 설계

  • 행동과 하위 목표의 공동 예측: 로봇이 무엇을 할지와 다음에 무엇을 보게 될지를 함께 모델링해 계획과 제어를 연결한다.
  • 희소한 미래 표현: 조밀한 영상 대신 작업에 중요한 시각 상태만 유지해 장기 미래 상상의 비용을 줄인다.
  • 특징 캐싱: 비디오 백본을 한 번만 순전파해 하위 목표 특징을 저장한다. 재계획에서는 전체 영상을 반복 생성하지 않고 가벼운 행동 디노이징을 수행한다.
  • 행동 라벨이 없는 영상 활용: 하위 목표 예측은 대규모 액션 프리 영상으로 학습할 수 있다. 이에 따라 복잡한 시각 계획을 비디오 백본이 분담하고, 행동 정책은 제어에 집중할 수 있다.

결과와 의미

논문이 보고한 평가에서 ProWAM은 LIBERO-Plus에서 85.8%, 랜덤화 RoboTwin에서 75.7%의 성공률을 기록했다. RoboCasa365에서는 전체 성공률 48.1%, 난도가 높은 Composite-Unseen 분할에서 18.2%를 달성했다. 또한 가장 강한 기준선과 비교해 최대 35.9%의 상대적 향상이 보고됐다. 이는 희소한 점진적 시각 안내가 미래 생성 비용을 낮추는 동시에 훈련 분포 밖의 제어에도 도움을 줄 가능성을 보여준다.

다만 제공된 소재에는 상세한 절제 실험, 하드웨어 구성, 실제 로봇 배치 결과가 포함되어 있지 않다. 따라서 카메라 잡음, 구동 오차, 추론 지연, 물리적 안전 요구가 있는 환경에서 얼마나 안정적으로 작동하는지는 논문 전문과 추가 실험을 통해 확인해야 한다. 제시된 수치는 실제 배치 가능성을 완전히 검증한 결과라기보다, 제안된 모델링 방향을 뒷받침하는 근거로 보는 편이 타당하다.

ProWAM의 broader한 의미는 세계 모델이 미래의 모든 프레임을 생성할 필요는 없다는 데 있다. 의미 있는 시각 상태를 소수의 단계로 구성하면 작업 진행 정보를 전달하면서 반복적인 비디오 합성을 피할 수 있다. 이 아이디어가 실제 환경에서도 유지된다면, 체화 AI는 계획 품질과 추론 비용, 장기 일반화 사이에서 더 나은 균형을 찾을 수 있을 것이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
JEPA-TTT, 배포 후에도 세계 모델의 동역학을 적응시키다
월드 모델
cctest.ai
월드 모델

JEPA-TTT, 배포 후에도 세계 모델의 동역학을 적응시키다

JEPA-TTT는 학습 환경과 다른 동역학이 나타났을 때 사전 학습된 JEPA 세계 모델을 테스트 중에도 계속 조정하는 방법입니다. 시각 인코더와 보상 헤드는 고정하고 잠재 동역학 예측기만 자기지도 방식으로 업데이트합니다.

더 보기
CCTest · Blog
QuantWM, 비디오 월드 모델의 2비트 KV 캐시 양자화에서 주의 패턴을 보존
월드 모델
cctest.ai
월드 모델

QuantWM, 비디오 월드 모델의 2비트 KV 캐시 양자화에서 주의 패턴을 보존

비디오 월드 모델은 장기 시간 일관성을 위해 KV 캐시를 계속 저장하지만, 낮은 비트 양자화는 화면 깜빡임을 유발할 수 있습니다. QuantWM은 단순한 수치 오차가 아니라 어텐션의 동작을 보존하는 방식으로 이 문제를 다룹니다.

더 보기