HLA-WM, 주소 지정 메모리로 장기 비디오 월드 모델의 망각 완화
들어가며
장기 비디오 월드 모델은 한 프레임씩 그럴듯한 영상을 만드는 것만으로 충분하지 않다. 긴 롤아웃 동안 장면의 구조, 물체의 위치, 카메라 움직임을 유지하고, 카메라가 이전에 방문한 장소로 돌아왔을 때 같은 세계를 일관되게 재현해야 한다. 과거 장면을 제대로 불러오지 못하면 공간적 드리프트, 물체 불일치, 시점 제어 오류가 쉽게 발생한다.
논문 「HLA-WM」은 이 문제를 해결하기 위해 추가 학습이 필요 없는 하이브리드 선형 어텐션 프레임워크를 제안한다. 전체 KV 캐시가 제공하는 직접적인 이력 접근성과 순환 선형 어텐션의 낮은 메모리 비용을 유지하면서, 후자의 장기 망각 문제를 줄이는 것이 목표다.
핵심 내용
- 두 메모리 방식의 상충 관계를 다룬다. Softmax 어텐션은 전체 생성 이력을 KV 캐시에 보존하지만 영상이 길어질수록 메모리 사용량이 증가한다. Gated DeltaNet(GDN)은 이력을 고정 크기 상태로 압축해 효율적이지만, 새로운 업데이트가 이어지면서 멀리 있는 중요 정보가 점차 약해질 수 있다.
- 이력을 청크 단위로 요약한다. HLA-WM은 GDN의 아핀 구조를 활용해 시간별 청크의 전이 정보를 압축된 요약 형태로 저장한다.
- 카메라 기하를 검색 주소로 사용한다. 새 콘텐츠를 생성할 때 현재 카메라 시점과 관련성이 높은 과거 청크를 기하 정보로 찾는다. 모든 과거를 동일하게 유지하는 대신 현재 장면 재현에 필요한 이력을 선택적으로 복원하는 방식이다.
- 질의에 맞는 순환 상태를 다시 만든다. 검색된 청크를 단순히 이어 붙이지 않고, 현재 질의에 맞는 재귀 선형 상태로 재구성한다.
- 일관성과 제어 지표를 모두 개선했다. 60초 SANA-WM-Bench에서 기본 자기회귀 생성기의 6개 종합 재방문 일관성 및 카메라 제어 지표를 모두 높였다. PSNR은 0.74 dB 상승했고 회전 오차는 28.5% 감소했다. 후속 refinement 이후에도 개선이 유지됐으며, MBench-A의 547개 샘플, 4개 서브셋, 모든 평가 추론 모드에서도 3개 재방문 일관성 지표가 일관되게 향상됐다.
- 메모리 절감 폭이 크다. 60초 문맥에서 전체 KV 캐시와 비교해 과거 상태 메모리를 12배 줄였고, 추론 처리량 감소는 최대 1.6%였다.
의미와 영향
HLA-WM의 핵심 시사점은 장기 기억을 전부 보존하거나 무조건 고정 크기로 압축해야 하는 것은 아니라는 점이다. 카메라 제어 비디오에서는 공간 기하가 기억의 주소 역할을 할 수 있다. 이를 통해 선형 어텐션의 효율성을 유지하면서 현재 시점과 관련된 과거 장면만 선택적으로 읽어올 수 있다.
이 접근법은 장시간 생성, 동일 장소 재방문, 긴 카메라 궤적을 요구하는 월드 모델에 특히 유용하다. 다만 제시된 결과는 특정 기반 생성기와 벤치마크, 검색 설정에서 얻어진 것이며, 기하 매칭과 청크 요약의 품질이 다른 환경의 성능에 영향을 줄 수 있다. 그럼에도 HLA-WM은 추가 학습이나 단순한 모델 확장 대신, 추론 단계에서 메모리를 조직하는 방법으로 비디오 월드 모델의 유효 시간 범위를 넓힐 수 있음을 보여준다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…