ReWorld, 인터랙티브 월드 모델에 장기 기억을 더하다
들어가며
인터랙티브 월드 모델은 그럴듯한 영상을 만드는 데서 끝나지 않습니다. 사용자의 입력을 따라 움직이고, 카메라 동작을 일관되게 유지하며, 한참 뒤 다시 방문한 장소를 기억해야 합니다. 문제는 행동 제어가 최근 프레임에 집중할수록 유리한 반면, 장기 기억은 긴 과거 정보를 요구한다는 점입니다. Hugging Face Daily Papers에 소개된 ReWorld는 학습과 추론 구조를 함께 바꿔 이 충돌을 다룹니다.
핵심 설계
- 주의 헤드에 서로 다른 시간 범위를 부여한다. 대부분의 헤드는 최근 과거만 보도록 제한해 현재 입력과 화면 변화를 처리합니다. 소수의 글로벌 헤드는 전체 히스토리를 참조합니다. 학습 중 헤드를 무작위로 라우팅해 기억이나 제어 능력이 특정 헤드에 고정되지 않도록 했고, 히스토리 청크를 무작위로 제거해 듬성듬성한 과거 정보도 정상적인 입력으로 학습시켰습니다.
- 고정 예산으로 장기 기억을 검색한다. ReWorld는 추론 때 KV 캐시를 계속 늘리지 않습니다. 대신 제한된 KV 캐시를 사용하고, 카메라 포즈로 색인된 랜드마크 뱅크를 별도로 둡니다. 현재 포즈와 가까운 랜드마크를 검색하면, 이전에 방문한 장소의 관련 정보를 현재 문맥으로 다시 가져올 수 있습니다.
- 서로 다른 데이터의 행동 의미를 통일한다. 데이터 엔진은 Unreal 렌더링 비행 영상, 게임 내 이동, 실제 영상 등 8개 소스를 하나의 물리적 행동 스케일에 맞춥니다. 같은 키 입력이 데이터 소스가 달라도 비슷한 카메라 이동 거리를 의미하도록 만든 것입니다. 왕복 경로를 포함한 회문형 궤적은 동일한 장소를 다시 보는 학습 신호로 활용됩니다.
- 하나의 백본으로 품질과 속도를 절충한다. 분포 매칭 증류를 LoRA 어댑터에만 적용해 샘플링 단계를 4단계로 줄였습니다. 그 결과 같은 백본이 고품질 다단계 모드와 실시간 인터랙티브 모드를 모두 지원할 수 있습니다. 보고된 출력은 704×1280 해상도이며, 사실적·게임풍·스타일화된 세계를 포함합니다.
평가와 영향
논문은 행동 추종, 장기 회상, 영상 품질이라는 세 축으로 평가했습니다. 6개의 최신 인터랙티브 월드 모델과 비교한 결과, ReWorld는 11.95°의 회전 오차와 높은 카메라 움직임 일관성을 포함해 최상의 제어 충실도를 기록했고, 생성 품질에서도 가장 좋은 결과를 보고했습니다. 384개 잠재 표현으로 구성된 64초 왕복 롤아웃에서는 고정된 12개 청크 캐시만으로 시작 장면을 다시 생성했습니다. 단순 슬라이딩 윈도우는 관련 기록을 일찍 버리고, 전체 KV 캐시는 길이에 따라 비용이 증가하는 것과 대비됩니다.
ReWorld의 핵심 의미는 장기 기억을 무한한 컨텍스트의 문제로만 보지 않고, 짧은 시간 처리와 공간적으로 주소 지정 가능한 기억의 결합으로 재구성했다는 데 있습니다. 게임, 합성 환경, 실제 영상 사이의 행동 의미 차이를 공통 스케일로 줄인 점도 다양한 데이터 활용에 유용합니다. 다만 제공된 요약에는 하드웨어 구성, 실제 지연 시간, 전체 벤치마크 수치가 없습니다. 따라서 실시간 성능과 일반화 능력은 논문 전문과 독립적인 테스트를 통해 확인해야 합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…