WCM: VLA 강화학습 critic에 세계 모델을 넣다
도입
Vision-Language-Action(VLA) 모델은 시각 장면과 언어 지시를 이해하고 로봇 행동으로 변환하는 유망한 방향으로 자리 잡고 있다. 여기에 강화학습 기반 후처리를 적용하면 조작 성능을 더 끌어올릴 수 있다는 결과도 늘고 있다. 하지만 이 과정에서 가치 추정기, 즉 critic은 여전히 중요한 병목으로 남아 있다. 많은 기존 critic은 단일 프레임 관측이나 단일 프레임에서 나온 VLM 잠재 표현에 의존한다.
WCM(World Critic Model)은 바로 이 설계가 로봇 제어의 본질과 어긋난다고 본다. 로봇 조작은 정적인 이미지 이해 문제가 아니라 부분 관측 환경에서 진행되는 동적인 제어 문제다. 한 장의 이미지로는 물체의 움직임, 접촉 진행 상황, 작업의 중간 단계, 다음 상태의 변화를 충분히 담아내기 어렵다.
핵심 요점
- 프레임을 더 쌓는 것만으로는 부족하다: 자료는 단순히 관측 이력을 추가하는 방식이 고차원 시각 공간에서 복잡도를 크게 높인다고 설명한다. 또한 스칼라 리턴 회귀만으로는 감독 신호가 너무 희소해, critic이 시간에 따른 환경 변화를 제대로 학습하기 어렵다.
- 문제의 뿌리는 상태 근사다: 부분 관측 환경에서 critic은 현재 작업 진행 상황을 요약하는 내부 상태를 가져야 한다. 명시적인 세계 모델링 목표가 없으면 가치 추정에 필요한 시간 구조를 표현하기 어렵다.
- WCM은 미래 예측과 가치 추정을 결합한다: WCM은 경량 LeJEPA 아키텍처를 기반으로 미래 잠재 상태 예측과 가치 추정을 동시에 학습한다. 즉 critic은 최종 보상만 맞히는 것이 아니라, 잠재 공간에서 환경이 어떻게 변할지를 배우도록 훈련된다.
- 기존 VLA 강화학습 흐름에 연결 가능하다: 자료에 따르면 WCM은 on-policy와 off-policy 학습 파이프라인 모두에 통합될 수 있으며, Pi0, Pi0.5, OpenVLA-OFT 같은 최신 VLA 백본과 호환된다.
- 평가 범위가 넓다: 논문 초록은 4개 벤치마크의 149개 과제에서 실험했다고 밝힌다. 추가 설명에는 ManiSkill, LIBERO-Plus, 그리고 천 접기나 컨베이어 벨트 위 초밥 집기 같은 7개 실제 조작 과제도 언급된다.
의미와 영향
WCM의 의미는 단순히 VLA 강화학습에 새 모듈을 더한 데 있지 않다. critic의 역할을 재정의한다는 점이 더 중요하다. 기존 critic이 보상을 예측하는 회귀기에 가까웠다면, WCM은 critic을 세계의 변화를 예측하는 상태 표현 학습기로 바꾸려 한다.
로봇 조작에서는 이런 변화가 특히 중요하다. 성공 여부는 그리퍼가 물체에 제대로 닿았는지, 물체가 곧 미끄러질지, 변형 가능한 물체가 접기에 적절한 상태인지 같은 숨은 과정에 크게 좌우된다. 이런 정보는 단일 이미지에서 안정적으로 판단하기 어렵지만, 좋은 가치 추정을 위해서는 반드시 필요한 단서다.
자료에서 보고된 결과가 더 다양한 환경에서도 재현된다면, VLA 후처리 연구는 정책 자체의 업데이트뿐 아니라 critic이 시간적 구조를 얼마나 잘 이해하는지에 더 큰 비중을 둘 가능성이 있다. 또한 세계 모델이 미래 영상 생성이나 계획에만 쓰이는 것이 아니라, 강화학습 critic을 위한 구조화된 감독 신호가 될 수 있음을 보여준다.
다만 현재 공개된 내용은 주로 논문 초록과 저자 소개에 기반하므로, 구체적인 학습 비용, 세부 ablation, 실제 로봇 전이의 한계는 원문을 통해 더 확인해야 한다. 그럼에도 WCM의 메시지는 분명하다. 로봇 critic은 현재를 보는 데서 멈추지 않고, 다음에 무엇이 일어날지까지 학습해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…