LOCI, 영상 세계 모델에 공간 기억을 더하다
들어가며
영상 세계 모델이 일관된 환경을 생성하려면 다음 프레임을 예측하는 것만으로는 부족하다. 카메라가 한 장소를 촬영한 뒤 다른 방향으로 이동하고, 나중에 같은 장소로 돌아왔을 때 이전에 보았던 물체와 배치, 시각적 세부를 다시 보여줘야 한다. 하지만 전체 영상을 그대로 기억하면 시퀀스가 길어질수록 메모리 비용이 커지고, 과거를 작은 고정 상태로 압축하면 특정 관측을 직접 찾아오기 어려워진다.
LOCI는 이 상충하는 요구를 두 종류의 메모리를 함께 사용하는 방식으로 다룬다.
캐시와 선형 메모리의 결합
LOCI의 Transformer 블록은 서로 다른 기억 역할을 나눠 맡는다.
- 절반의 블록은 과거 관측을 키-값 캐시로 보존한다. 캐시의 항목에 직접 접근할 수 있어 시각적 세부를 유지하는 데 유리하지만, 일반적인 방식에서는 영상 기록이 길어질수록 메모리 사용량도 증가한다.
- 나머지 블록은 어텐션 범위를 현재 청크로 제한하고 순환 선형 어텐션 메모리를 추가한다. 이 메모리는 과거 정보를 더 작은 상태로 누적하면서 스트리밍 처리를 가능하게 한다.
- 메모리의 읽기와 쓰기는 카메라의 투영 기하에 의해 조건화된다. 모델은 단순히 외형이 비슷한 정보를 찾는 것이 아니라 현재 시점과 공간적 관계를 고려해 관측을 저장하고 검색한다.
- 순환 메모리의 읽기 결과는 이후의 캐시 기반 블록으로 전달된다. 그 결과 캐시에서 세부 정보를 조회하는 쿼리가 축적된 장면 문맥을 함께 활용할 수 있다.
핵심은 압축된 장기 문맥과 직접 접근 가능한 고해상도 기록을 분리하는 데 있다. 순환 메모리만 사용하면 효율적이지만 개별 과거 관측을 잃을 수 있고, 전체 키-값 기록만 사용하면 검색 비용과 메모리 사용량이 커진다. LOCI는 두 구조를 병렬적으로 배치하고, 카메라 기하를 통해 현재 관점에 맞는 기억을 선택하려 한다.
보고된 결과
제공된 자료에 따르면 LOCI는 공개 MIND memory benchmark와 Unreal Engine에서 기록한 홀드아웃 궤적에서 평가됐다. 카메라가 이전 지역을 다시 방문하는 상황에서 LOCI는 여러 대표 세계 모델과 같은 설계 원칙을 적용한 full-Softmax 기준선보다 과거 콘텐츠를 더 충실하게 재현했다.
전체 기록을 사용하는 조건에서는 동일한 시퀀스 길이에서 full Softmax 대비 피크 메모리를 약 30% 낮췄다. 보존 관측 수에 상한을 둔 경우에는 긴 영상을 일정한 메모리로 스트리밍하면서도 같은 메모리 예산의 full Softmax보다 높은 재현성을 유지했다고 보고됐다. 이는 단순히 메모리를 줄이는 것보다, 공간 정보를 이용해 제한된 저장 공간을 선택적으로 활용하는 것이 중요할 수 있음을 보여준다.
의미와 남은 질문
LOCI는 장기 일관성이 필요한 영상 생성과 상호작용형 환경 시뮬레이션을 위한 설계 방향을 제시한다. 캐시는 세부 정보를 보존하고, 선형 메모리는 지속적인 장면 문맥을 전달하며, 카메라 기하는 현재 관점과 과거 관측을 연결한다는 구도다.
다만 제공된 자료만으로는 실제 카메라 노이즈, 복잡하게 움직이는 환경, 더 큰 모델 규모에서의 일반화 성능까지 판단하기 어렵다. 연구팀은 게임 엔진 영상과 정확한 카메라 자세, 깊이, 재방문 쌍을 포함한 LOCI-revisit-data를 공개했으며 프로젝트 페이지와 코드도 제공한다. 이 자료는 세계 모델의 장기 기억과 장면 일관성을 재현하고 비교하는 데 활용될 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…