아티클 목록으로
추론·배포

vLLM DCP, 긴 컨텍스트 추론의 KV 캐시 병목을 겨냥하다

약 3분 소요

들어가며

긴 컨텍스트 추론은 이제 모델 성능 시연용 기능을 넘어 에이전트형 AI 서비스의 핵심 부하가 되고 있다. 대규모 코드 저장소, 긴 대화 기록, 여러 단계의 도구 호출 흔적을 처리하면 입력 길이는 64K token을 넘고, 일부 워크로드는 1M token까지 도달한다. vLLM 블로그가 주목한 문제는 이때 decode 단계의 KV 캐시가 GPU 메모리를 잠식해 동시 처리와 처리량을 제한한다는 점이다.

핵심 포인트

  • 기존 TP는 KV 캐시 분할에 구조적 한계가 있다. 일반적인 tensor parallelism은 어텐션 헤드를 기준으로 KV 캐시를 나눈다. 그러나 GQA 모델은 KV 헤드 수가 적어 병렬도가 커지면 더 이상 나눌 헤드가 부족해지고, 여러 GPU가 같은 캐시를 복제하게 된다. MLA 모델은 Key/Value를 공유 저랭크 latent로 압축하므로 헤드 기준 분할 여지가 더 작다.
  • DCP는 시퀀스 차원으로 캐시를 나눈다. Decode Context Parallelism은 같은 요청의 KV 캐시를 토큰 위치 구간별로 여러 GPU에 배치한다. 예를 들어 200K token 컨텍스트를 여러 구간으로 나누면 각 GPU는 전체 캐시의 일부만 저장한다. 그 결과 GPU당 캐시 점유가 줄고, 더 큰 batch와 더 높은 동시 요청을 수용할 수 있다.
  • decode 특성에 맞춘 통신 구조를 사용한다. DCP는 query를 모으고, 각 GPU가 자기 KV 조각에 대해 attention을 계산한 뒤, 부분 결과를 합친다. decode에서는 새 query가 한 token이기 때문에 query all-gather 비용이 상대적으로 작다. MLA의 경우 vLLM은 query projection을 DCP 그룹 내에 복제해 해당 all-gather를 건너뛸 수 있는 선택지도 제시한다.
  • 효과는 긴 컨텍스트와 높은 동시성에서 두드러진다. 블로그 실험은 단일 8×B200 노드에서 Kimi K2.6을 NVFP4와 vLLM으로 서비스하며 진행됐다. 기준 TP는 동시성 64에서 KV 사용률이 100%에 도달했고 처리량은 약 1,863 tok/s/GPU 부근에서 정체됐다. 반면 DCP는 동시성 512에서도 KV 사용률 82%를 유지하며 6,091 tok/s/GPU를 기록했다. 블로그는 이를 긴 컨텍스트 에이전트 워크로드에서 약 3배 처리량 향상으로 정리한다.

의미와 영향

DCP의 핵심은 단일 긴 요청 하나를 무조건 빠르게 만드는 데 있지 않다. 더 중요한 점은 긴 입력을 가진 여러 에이전트 세션을 같은 GPU 풀에서 더 많이 수용하게 만든다는 것이다. KV 캐시 복제로 인한 메모리 낭비를 줄이면 서비스는 더 큰 batch를 운용할 수 있고, 사용자 체감 응답성과 토큰당 비용에도 직접적인 영향을 줄 수 있다.

또한 GQA와 MLA가 널리 쓰일수록 헤드 기준 분할만으로는 확장에 한계가 빨리 온다. vLLM의 DCP는 긴 컨텍스트 시대의 추론 서빙에서 캐시 배치, GPU 간 통신, 배치 전략이 모델 자체의 연산 최적화만큼 중요해지고 있음을 보여준다.

출처: vLLM Blog

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
GPTQ-2D: 양측 적응형 반올림을 4차 시간에서 3차 시간으로
추론·배포
cctest.ai
추론·배포

GPTQ-2D: 양측 적응형 반올림을 4차 시간에서 3차 시간으로

GPTQ-2D는 잔차의 왼쪽과 오른쪽 모두에 기저 행렬이 작용하는 더 일반적인 적응형 반올림 문제를 다룬다. 단순 벡터화 방식과 동일한 반올림 결과를 유지하면서, 반대각선 단위 처리로 계산 복잡도를 3차 시간으로 낮춘다.

더 보기
CCTest · Blog
투기적 디코딩의 손실 검증 재검토: 더 빠른 추론이 바꾸는 생성 분포
추론·배포
cctest.ai
추론·배포

투기적 디코딩의 손실 검증 재검토: 더 빠른 추론이 바꾸는 생성 분포

이 논문은 투기적 디코딩에서 손실 검증이 효율을 높이는 동시에 모델의 디코딩 분포를 바꿀 수 있음을 분석한다. 검증을 느슨하게 하는 방식은 속도 향상뿐 아니라 품질 저하 위험도 함께 가져온다.

더 보기