아티클 목록으로
월드 모델

WCM: VLA 강화학습 critic에 세계 모델을 넣다

약 3분 소요

도입

Vision-Language-Action(VLA) 모델은 시각 장면과 언어 지시를 이해하고 로봇 행동으로 변환하는 유망한 방향으로 자리 잡고 있다. 여기에 강화학습 기반 후처리를 적용하면 조작 성능을 더 끌어올릴 수 있다는 결과도 늘고 있다. 하지만 이 과정에서 가치 추정기, 즉 critic은 여전히 중요한 병목으로 남아 있다. 많은 기존 critic은 단일 프레임 관측이나 단일 프레임에서 나온 VLM 잠재 표현에 의존한다.

WCM(World Critic Model)은 바로 이 설계가 로봇 제어의 본질과 어긋난다고 본다. 로봇 조작은 정적인 이미지 이해 문제가 아니라 부분 관측 환경에서 진행되는 동적인 제어 문제다. 한 장의 이미지로는 물체의 움직임, 접촉 진행 상황, 작업의 중간 단계, 다음 상태의 변화를 충분히 담아내기 어렵다.

핵심 요점

  • 프레임을 더 쌓는 것만으로는 부족하다: 자료는 단순히 관측 이력을 추가하는 방식이 고차원 시각 공간에서 복잡도를 크게 높인다고 설명한다. 또한 스칼라 리턴 회귀만으로는 감독 신호가 너무 희소해, critic이 시간에 따른 환경 변화를 제대로 학습하기 어렵다.
  • 문제의 뿌리는 상태 근사다: 부분 관측 환경에서 critic은 현재 작업 진행 상황을 요약하는 내부 상태를 가져야 한다. 명시적인 세계 모델링 목표가 없으면 가치 추정에 필요한 시간 구조를 표현하기 어렵다.
  • WCM은 미래 예측과 가치 추정을 결합한다: WCM은 경량 LeJEPA 아키텍처를 기반으로 미래 잠재 상태 예측과 가치 추정을 동시에 학습한다. 즉 critic은 최종 보상만 맞히는 것이 아니라, 잠재 공간에서 환경이 어떻게 변할지를 배우도록 훈련된다.
  • 기존 VLA 강화학습 흐름에 연결 가능하다: 자료에 따르면 WCM은 on-policy와 off-policy 학습 파이프라인 모두에 통합될 수 있으며, Pi0, Pi0.5, OpenVLA-OFT 같은 최신 VLA 백본과 호환된다.
  • 평가 범위가 넓다: 논문 초록은 4개 벤치마크의 149개 과제에서 실험했다고 밝힌다. 추가 설명에는 ManiSkill, LIBERO-Plus, 그리고 천 접기나 컨베이어 벨트 위 초밥 집기 같은 7개 실제 조작 과제도 언급된다.

의미와 영향

WCM의 의미는 단순히 VLA 강화학습에 새 모듈을 더한 데 있지 않다. critic의 역할을 재정의한다는 점이 더 중요하다. 기존 critic이 보상을 예측하는 회귀기에 가까웠다면, WCM은 critic을 세계의 변화를 예측하는 상태 표현 학습기로 바꾸려 한다.

로봇 조작에서는 이런 변화가 특히 중요하다. 성공 여부는 그리퍼가 물체에 제대로 닿았는지, 물체가 곧 미끄러질지, 변형 가능한 물체가 접기에 적절한 상태인지 같은 숨은 과정에 크게 좌우된다. 이런 정보는 단일 이미지에서 안정적으로 판단하기 어렵지만, 좋은 가치 추정을 위해서는 반드시 필요한 단서다.

자료에서 보고된 결과가 더 다양한 환경에서도 재현된다면, VLA 후처리 연구는 정책 자체의 업데이트뿐 아니라 critic이 시간적 구조를 얼마나 잘 이해하는지에 더 큰 비중을 둘 가능성이 있다. 또한 세계 모델이 미래 영상 생성이나 계획에만 쓰이는 것이 아니라, 강화학습 critic을 위한 구조화된 감독 신호가 될 수 있음을 보여준다.

다만 현재 공개된 내용은 주로 논문 초록과 저자 소개에 기반하므로, 구체적인 학습 비용, 세부 ablation, 실제 로봇 전이의 한계는 원문을 통해 더 확인해야 한다. 그럼에도 WCM의 메시지는 분명하다. 로봇 critic은 현재를 보는 데서 멈추지 않고, 다음에 무엇이 일어날지까지 학습해야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
ODEWorld: 세계 모델을 연속 시간 잠재 동역학으로 재구성하다
월드 모델
cctest.ai
월드 모델

ODEWorld: 세계 모델을 연속 시간 잠재 동역학으로 재구성하다

ODEWorld는 고정된 시간 간격의 다음 상태 예측 대신, 물리 시간에서 움직이는 연속 잠재 속도장을 학습합니다. 이를 통해 임의의 시간 해상도 예측, 역방향 예측, 로봇 계획에 유용한 동역학 표현을 목표로 합니다.

더 보기