아티클 목록으로
월드 모델

WorldCycle: 되돌아오는 동작 순환으로 비디오 월드 모델 학습

약 2분 소요

비디오 월드 모델은 짧은 구간에서는 자연스럽게 보이지만, 시간이 길어질수록 오차가 누적되어 시작 상태로 정확히 돌아오지 못하는 경우가 많습니다. WorldCycle은 이 문제를 단순한 생성 품질의 한계가 아니라, 장기 정합성을 검증할 방법이 부족한 문제로 봅니다. 임의의 동작 시퀀스에는 정답 미래 상태가 없기 때문에, 긴 시간의 드리프트를 직접 측정하기 어렵다는 것입니다.

해결 아이디어는 의외로 단순합니다. 어떤 동작과 그 역동작을 합쳤을 때 원래 상태로 돌아와야 한다는 점을 학습에 이용하는 것입니다. 즉, 가역적 동작 순환 자체를 검증 가능한 감독 신호로 삼습니다. 논문은 이를 위해 두 가지 보상을 사용합니다.

  • 공간 폐쇄 보상: 전진 구간과 역순 구간이 중간 단계에서도 대칭적으로 맞는지 확인합니다.
  • 시간 일관성 보상: 같은 순환을 반복했을 때 대응 상태가 안정적으로 유지되는지 확인합니다.

이 방식은 모델이 동작을 단순한 시간 패턴으로 외우는 대신, 상태를 일관되게 변환하는 연산자로 학습하도록 유도합니다. 또한 이동과 회전이 섞인 복합 동작처럼, 기존 모델이 약한 조합적 상황에도 자연스럽게 확장됩니다.

저자들은 이를 측정하기 위한 진단 벤치마크 CycleBench도 공개했습니다. 이 벤치마크는 가역, 반복, 복합 동작에서 모델이 얼마나 잘 상태를 복원하는지 평가합니다. 따라서 평가는 “영상이 예쁜가”보다 “시뮬레이터처럼 상태를 유지하는가”에 더 가까워집니다.

결과적으로 WorldCycle은 상태 복귀 드리프트를 최대 44% 줄였고, 복합 동작 정확도를 거의 4배 높였습니다. 장기 계획, embodied AI, 물리 기반 세계 모델에서 중요한 것은 다음 장면 예측만이 아니라 상태 보존과 자기 검증 능력이라는 점을 잘 보여줍니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
MiniWorld: 비디오 월드 모델을 처음부터 학습하는 경량 기준선
월드 모델
cctest.ai
월드 모델

MiniWorld: 비디오 월드 모델을 처음부터 학습하는 경량 기준선

MiniWorld는 대규모 사전학습 비디오 생성 모델을 개조하는 방식에서 벗어나, 비디오 월드 모델을 처음부터 재현 가능하게 학습하는 프레임워크를 제안한다. 핵심은 인과적 스트리밍 추론, 제한된 연산 자원, 공개 코드다.

더 보기