아티클 목록으로
메모리·컨텍스트

KV 상태 저장으로 AI가 5000만 토큰의 기록을 재사용하는 방법

약 3분 소요

들어가며

긴 문맥을 처리하는 AI의 비용은 문맥 창의 크기만으로 결정되지 않는다. 같은 기록을 다시 질의할 때마다 모델이 원문을 읽고 내부 상태를 다시 계산해야 한다는 점도 큰 부담이다. Hugging Face Daily Papers에 소개된 연구는 galahad-kv라는 메모리 계층을 시험했다. 모델이 텍스트를 처리한 뒤 생성한 키-값 상태(KV cache)를 약 1만6000토큰 단위의 블록으로 나누어 암호화된 로컬 NVMe에 저장하고, 이후 필요할 때 불러오는 방식이다.

즉, 새로운 영구 기억 모델을 학습한 것이 아니라 추론 중간 상태를 보존해 반복 계산을 줄이는 접근이다.

실험의 핵심 결과

  • 5000만 토큰 규모로 검증했다. vLLM과 NVIDIA H100 한 장을 사용해 Gemma 4 12B와 31B로 실제 공개 텍스트를 처리했다.
  • 재계산 없이 상태를 복원했다. 텍스트 깊이 0부터 5000만 토큰까지 여러 지점에서 100개 블록을 확인했으며, 두 모델 모두 모든 블록을 저장소에서 불러왔다. 복원된 상태는 바이트 단위로 일치했다.
  • 속도와 GPU 에너지를 줄였다. 블록 로딩은 재계산보다 약 2.84.3배 빨랐고, GPU 에너지 사용량은 약 8.812.3배 낮았다. 처리하는 기록이 늘어도 GPU 메모리는 일정하게 유지됐다.
  • 기억 활용 능력은 모델마다 달랐다. 수백만 토큰 앞에 심어 둔 사실을 묻자 12B 모델은 100회 중 82회, 31B 모델은 98회 정답을 냈다. 제공된 결과에서는 두 모델 모두 답을 지어내지 않았다.

어떤 문제를 해결하나

장기 실행 에이전트, 문서 질의 시스템, 코드베이스 분석, 지속적인 대화처럼 동일한 자료를 반복해서 참고하는 서비스에서는 매번 전체 기록을 다시 입력하는 일이 비효율적이다. KV 상태를 첫 처리 때 저장하면 이후 요청은 원문을 다시 프리필하는 비용을 피할 수 있다. 모든 과거 토큰을 GPU에 계속 보관하지 않아도 되므로, 서비스 메모리 운용에도 도움이 될 수 있다.

5000만 토큰짜리 주의집중 창은 아니다

이 방식이 모델의 주의집중 범위를 5000만 토큰으로 확장하는 것은 아니다. 실험에서는 한 번에 하나의 블록을 불러온다. 어떤 블록을 선택하는지, 그리고 모델이 그 안의 정보를 얼마나 잘 활용하는지에 따라 답변 결과가 달라진다. 따라서 이 저장 계층은 검색이나 에이전트 오케스트레이션을 대체하기보다 이를 지원하는 외부 상태 저장소에 가깝다.

제약도 분명하다. 처음 KV 상태를 만드는 과정에는 여전히 원래의 계산 비용이 필요하며, 저장소에는 수 TB 규모의 NVMe 공간이 필요할 수 있다. 모델 구조, 블록 구성, 질문 유형에 따라 성능도 달라진다. 실제 도입을 평가할 때는 문맥 길이뿐 아니라 최초 기록 비용, 저장 용량, 로딩 지연, 전력, 검색 방식, 답변 정확도를 함께 측정해야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
EngramEdit, LLM의 사실 지식을 독립적으로 업데이트하다
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

EngramEdit, LLM의 사실 지식을 독립적으로 업데이트하다

EngramEdit는 조건부 메모리를 단순한 용량 확장 장치에서 편집 가능한 지식 인터페이스로 확장합니다. Transformer 본체를 고정한 채 공유 n-gram 임베딩을 업데이트해 여러 표현에 걸친 지식 수정과 부작용 억제를 시도합니다.

더 보기
CCTest · Blog
장문맥 하이브리드 모델의 성능을 좌우하는 위치 편향
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

장문맥 하이브리드 모델의 성능을 좌우하는 위치 편향

새 연구는 슬라이딩 윈도우 어텐션과 선형 어텐션이 문맥 확장과 길이 외삽에서 서로 다른 강점을 보인다고 분석했다. 연구진은 그 차이를 각 어텐션이 형성하는 ‘하이브리드 위치’ 편향으로 설명하고 Sliding-Window Linear Attention을 제안했다.

더 보기