아티클 목록으로
메모리·컨텍스트

LatentStream, 스트리밍 영상 기억을 검색에서 내재화로

약 3분 소요

들어가며

계속 들어오는 영상을 이해하는 일은 한 장의 이미지나 편집된 짧은 영상을 분석하는 것과 다르다. 멀티모달 대규모 언어 모델은 아직 등장하지 않은 미래 정보를 사용하지 않고 추론해야 하며, 동시에 나중에 질문에 답하는 데 필요한 과거 정보도 보존해야 한다. 몇 분 전에 나타난 사람이나 물체, 장면의 변화가 뒤늦은 질문의 핵심 근거가 될 수 있다.

기존의 대표적인 접근법은 과거 관찰을 외부 메모리 뱅크에 압축한 뒤, 질의가 들어오면 관련 영상 증거를 검색해 추가 문맥으로 제공하는 방식이다. 이 방법은 긴 입력 문맥의 부담을 줄이지만, 과거의 증거를 모델의 작업 상태 안에 완전히 통합하지는 않는다. 결과적으로 모델은 추론할 때마다 외부 기록을 다시 찾고 읽어야 한다.

LatentStream의 접근법

LatentStream은 영상 메모리를 “저장하고 검색하는” 구조에서 “검색하고 내재화하는” 구조로 바꾸려 한다. 단순히 메모리 저장량을 늘리는 것이 아니라, 검색된 증거를 이후 추론을 계속 지원할 수 있는 고정 길이의 잠재 작업 메모리로 변환하는 것이 핵심이다.

  • 영상 기록을 계층화한다. Query-agnostic Hierarchical Streaming Memory는 고정된 메모리 예산 안에서 영상을 단기·중기·장기 수준으로 정리한다. Jenks 기반 적응형 통합을 사용해 모든 정보를 동일한 규칙으로 압축하지 않고, 서로 다른 시간 범위에 맞춰 묶는다.
  • 기억의 범위를 점진적으로 넓힌다. 질의가 들어오면 Hierarchical Latent Memory Evolution은 잠재 메모리 토큰 그룹에 점점 넓어지는 수용 영역을 부여한다. 각 그룹은 담당 범위에서 근거를 검색하고 이를 고정 길이 잠재 상태에 내재화한 뒤, 더 넓은 과거 기록에 접근한다.
  • 신뢰도를 이용해 메모리를 다듬는다. Progressive Confidence-guided Latent Memory Optimization은 그룹별 예측 엔트로피를 바탕으로 계층적 진행 보상을 구성한다. 이를 통해 잠재 메모리를 공동으로 최적화하며, 어떤 정보를 찾았는지만 아니라 메모리 상태가 얼마나 안정적으로 발전했는지도 반영한다.

의미와 과제

LatentStream은 메모리를 단순한 검색용 저장소가 아니라 추론에 직접 참여하는 진화형 작업 상태로 본다. 고정 길이 잠재 표현을 사용하면 긴 영상을 처리할 때 시각 문맥을 반복적으로 이동시키는 부담을 줄이고, 온라인과 오프라인 영상 이해에 공통으로 적용할 수 있는 메모리 구조를 제공할 가능성이 있다.

다만 제공된 자료에는 구체적인 벤치마크 점수, 데이터셋별 비교, 소거 실험의 세부 내용이 없다. 따라서 보고된 성능 향상이 어느 구성 요소에서 비롯됐는지는 논문 전체를 확인해야 한다. 압축 과정에서 나중에 필요한 세부 정보가 사라지지 않는지, 초기 오류가 잠재 메모리에 고정되지 않는지, 질의에 따라 내재화된 기억이 서로 충돌하지 않는지도 중요한 검증 대상이다.

그럼에도 이 연구는 스트리밍 영상 이해의 방향을 잘 보여준다. 과거를 검색 가능한 형태로 보관하는 데 그치지 않고, 계속 사용할 수 있는 내부 기억을 형성하는 것이 다음 단계가 될 수 있다는 제안이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
KV 캐시 축출은 정교할 필요가 없을까: Random Attention의 재검토
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

KV 캐시 축출은 정교할 필요가 없을까: Random Attention의 재검토

Random Attention은 긴 추론 과정에서 KV 캐시의 모든 토큰을 중요도 점수로 선별하지 않아도 될 수 있음을 보였다. 프롬프트를 보존하고 각 어텐션 헤드에서 나머지를 무작위로 축출해도 강력한 기존 방식에 가까운 성능을 낸다.

더 보기
CCTest · Blog
LatentPress, 연속 메모리 토큰으로 LLM 컨텍스트를 직접 압축
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

LatentPress, 연속 메모리 토큰으로 LLM 컨텍스트를 직접 압축

LatentPress는 대화 기록과 긴 문서를 사람이 읽는 요약문이나 이미지가 아닌 연속 메모리 토큰으로 변환한다. 고정된 디코더가 입력 임베딩 인터페이스를 통해 이를 직접 읽기 때문에 추론 중 텍스트 복원 과정이 필요하지 않다.

더 보기