아티클 목록으로
월드 모델

HLA-WM, 주소 지정 메모리로 장기 비디오 월드 모델의 망각 완화

약 3분 소요

들어가며

장기 비디오 월드 모델은 한 프레임씩 그럴듯한 영상을 만드는 것만으로 충분하지 않다. 긴 롤아웃 동안 장면의 구조, 물체의 위치, 카메라 움직임을 유지하고, 카메라가 이전에 방문한 장소로 돌아왔을 때 같은 세계를 일관되게 재현해야 한다. 과거 장면을 제대로 불러오지 못하면 공간적 드리프트, 물체 불일치, 시점 제어 오류가 쉽게 발생한다.

논문 「HLA-WM」은 이 문제를 해결하기 위해 추가 학습이 필요 없는 하이브리드 선형 어텐션 프레임워크를 제안한다. 전체 KV 캐시가 제공하는 직접적인 이력 접근성과 순환 선형 어텐션의 낮은 메모리 비용을 유지하면서, 후자의 장기 망각 문제를 줄이는 것이 목표다.

핵심 내용

  • 두 메모리 방식의 상충 관계를 다룬다. Softmax 어텐션은 전체 생성 이력을 KV 캐시에 보존하지만 영상이 길어질수록 메모리 사용량이 증가한다. Gated DeltaNet(GDN)은 이력을 고정 크기 상태로 압축해 효율적이지만, 새로운 업데이트가 이어지면서 멀리 있는 중요 정보가 점차 약해질 수 있다.
  • 이력을 청크 단위로 요약한다. HLA-WM은 GDN의 아핀 구조를 활용해 시간별 청크의 전이 정보를 압축된 요약 형태로 저장한다.
  • 카메라 기하를 검색 주소로 사용한다. 새 콘텐츠를 생성할 때 현재 카메라 시점과 관련성이 높은 과거 청크를 기하 정보로 찾는다. 모든 과거를 동일하게 유지하는 대신 현재 장면 재현에 필요한 이력을 선택적으로 복원하는 방식이다.
  • 질의에 맞는 순환 상태를 다시 만든다. 검색된 청크를 단순히 이어 붙이지 않고, 현재 질의에 맞는 재귀 선형 상태로 재구성한다.
  • 일관성과 제어 지표를 모두 개선했다. 60초 SANA-WM-Bench에서 기본 자기회귀 생성기의 6개 종합 재방문 일관성 및 카메라 제어 지표를 모두 높였다. PSNR은 0.74 dB 상승했고 회전 오차는 28.5% 감소했다. 후속 refinement 이후에도 개선이 유지됐으며, MBench-A의 547개 샘플, 4개 서브셋, 모든 평가 추론 모드에서도 3개 재방문 일관성 지표가 일관되게 향상됐다.
  • 메모리 절감 폭이 크다. 60초 문맥에서 전체 KV 캐시와 비교해 과거 상태 메모리를 12배 줄였고, 추론 처리량 감소는 최대 1.6%였다.

의미와 영향

HLA-WM의 핵심 시사점은 장기 기억을 전부 보존하거나 무조건 고정 크기로 압축해야 하는 것은 아니라는 점이다. 카메라 제어 비디오에서는 공간 기하가 기억의 주소 역할을 할 수 있다. 이를 통해 선형 어텐션의 효율성을 유지하면서 현재 시점과 관련된 과거 장면만 선택적으로 읽어올 수 있다.

이 접근법은 장시간 생성, 동일 장소 재방문, 긴 카메라 궤적을 요구하는 월드 모델에 특히 유용하다. 다만 제시된 결과는 특정 기반 생성기와 벤치마크, 검색 설정에서 얻어진 것이며, 기하 매칭과 청크 요약의 품질이 다른 환경의 성능에 영향을 줄 수 있다. 그럼에도 HLA-WM은 추가 학습이나 단순한 모델 확장 대신, 추론 단계에서 메모리를 조직하는 방법으로 비디오 월드 모델의 유효 시간 범위를 넓힐 수 있음을 보여준다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
JEPA-TTT, 배포 후에도 세계 모델의 동역학을 적응시키다
월드 모델
cctest.ai
월드 모델

JEPA-TTT, 배포 후에도 세계 모델의 동역학을 적응시키다

JEPA-TTT는 학습 환경과 다른 동역학이 나타났을 때 사전 학습된 JEPA 세계 모델을 테스트 중에도 계속 조정하는 방법입니다. 시각 인코더와 보상 헤드는 고정하고 잠재 동역학 예측기만 자기지도 방식으로 업데이트합니다.

더 보기
CCTest · Blog
ProWAM, 점진적 시각 하위 목표로 로봇 장기 제어 강화
월드 모델
cctest.ai
월드 모델

ProWAM, 점진적 시각 하위 목표로 로봇 장기 제어 강화

ProWAM은 세계 행동 모델에 순서가 있는 희소 시각 하위 목표를 추가해 전체 미래 영상을 생성하지 않고도 로봇에 단계별 행동 지침을 제공한다. 여러 시뮬레이션 벤치마크에서 분포 밖 환경에 대한 강건성이 개선된 결과가 보고됐다.

더 보기