WROP, 월드 모델에 ‘물체 영속성’을 가르치다
영상 모델에 물체 영속성이 필요한 이유
공이 장애물 뒤로 사라져도 사람은 보통 공이 없어졌다고 생각하지 않는다. 보이지 않는 동안에도 공이 계속 존재하며, 어느 위치에서 다시 나타날지 추론한다. 이런 ‘물체 영속성’은 장면의 연속성을 이해하고 물리적 움직임을 예측하며 행동을 계획하는 데 필요한 기본 능력이다.
논문 「Training Object Permanence in World Models」는 현재 영상 생성 모델이 이 능력을 이미 갖추고 있는지, 부족하다면 전용 데이터로 학습할 수 있는지를 다룬다.
인지 개념을 규모 있는 학습 데이터로
연구진은 WROP(World Reasoning with Object Permanence)를 제안했다. WROP는 인지과학에서 영감을 얻어 직접 설계한 150개 과제로 구성된 데이터 인프라이며, 과제는 6개 인지 범주로 나뉜다. 주요 관심사는 가려진 물체의 존재, 움직임의 연속성, 물체의 고체성처럼 세계를 일관되게 이해하는 데 필요한 추론이다.
각 과제에는 Blender 기반 데이터 생성기가 연결된다. 생성기는 속도, 조명, 카메라 각도 같은 표면적 조건을 무작위로 바꾸면서도 과제의 인지적 구조는 유지한다. 따라서 모델이 특정 장면이나 고정된 움직임을 암기하는 것만으로는 대응하기 어렵고, 가림, 위치 변화, 물체 동일성 같은 관계를 학습하도록 유도할 수 있다.
과제마다 1만 개 이상의 다양한 샘플을 만들 수 있으며, 전체 학습 코퍼스는 150만 샘플로 구성됐다. 연구진은 모델 비교를 위한 300문항 시험도 함께 공개했다.
PWM-WROP의 평가 결과
실험에는 참조 이미지에서 영상을 만드는 모델 3개, 영상 편집 모델 7개, 영상 연속 생성 모델 4개 등 총 14개 모델이 참여했다. 이 가운데 PWM-WROP는 160억 개 파라미터를 가진 월드 모델이다.
블라인드 일대일 비교 결과를 Elo 점수로 집계한 결과, PWM-WROP는 연속 생성 모델 중 1위, 전체에서는 3위를 차지했다. 전체 1위와 2위는 참조 이미지 기반 영상 모델이었으며, 두 모델 사이의 차이는 통계적으로 동률이었다.
이 결과는 특정 인지 개념을 중심으로 설계한 데이터가 해당 세계 모델 과제의 성능을 높일 가능성을 보여준다. 다만 WROP에서 좋은 성적을 냈다고 해서 모델이 일반적인 물리 상식이나 인간 수준의 추론을 획득했다고 결론 내릴 수는 없다. 평가 대상은 연구진이 설계한 합성 과제와 시험에 한정되기 때문이다.
연구가 갖는 의미
WROP의 핵심 기여는 과제 설계, 절차적 데이터 생성, 학습 코퍼스, 평가 시험을 하나의 재현 가능한 틀로 묶었다는 점이다. 이를 통해 영상 모델이 그럴듯한 프레임을 생성하는 데 그치지 않고, 특정 인지 규칙을 실제로 처리하는지 확인할 수 있다.
이번 접근은 심리학과 인지과학의 개념을 월드 모델 학습에 도입하고, 추상적인 능력을 통제 가능하고 측정 가능한 과제로 분해하는 방향을 제시한다. 연구진은 데이터, 시험, 모델 답변, 점수, 가중치와 함께 AWS Trainium2용 네이티브 PyTorch 학습 스택인 PWM을 공개했다.
앞으로의 관건은 전이다. 학습된 능력이 새로운 장면, 실제 영상, 로봇과의 물리적 상호작용으로 확장될 수 있는지, 아니면 훈련 분포와 유사한 합성 과제에서만 강하게 나타나는지를 검증해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…