아티클 목록으로
추론·배포

vLLM, Kimi K3 Day-0 서빙 지원 공개

약 3분 소요

도입

Moonshot AI가 Kimi K3 가중치를 공개한 직후, vLLM은 day-0 서빙 지원을 발표했다. 이번 소식의 의미는 단순히 새 오픈웨이트 모델을 불러올 수 있다는 데 있지 않다. 2.8조 파라미터, 최대 100만 토큰 컨텍스트, 하이브리드 어텐션 구조, MoE, 네이티브 비전 기능을 갖춘 모델을 실제 운영 가능한 추론 경로로 정리했다는 점이 중요하다.

핵심 요점

  • 거대한 하이브리드 MoE 구조: Kimi K3는 토큰마다 896개 전문가 중 16개를 활성화한다. Kimi Delta Attention, Attention Residuals, LatentMoE, MXFP4 가중치를 사용하며, 추론 시스템은 희소 전문가 라우팅, 양자화 가중치, 긴 컨텍스트 메모리, 멀티모달 입력을 함께 처리해야 한다.
  • 하이브리드 캐시가 핵심: Kimi K3의 많은 층은 계속 커지는 KV 캐시 대신 고정 크기 순환 상태를 유지하는 KDA를 사용한다. 동시에 정확한 전역 회상을 위해 주기적인 full-attention 층도 포함된다. vLLM은 하나의 스케줄러 아래에서 full-attention용 paged KV 블록과 KDA용 순환 상태 블록을 함께 관리한다.
  • 프리픽스 캐싱 재설계: 일반적인 프리픽스 캐시는 토큰 단위 KV를 전제로 한다. 그러나 KDA는 토큰마다 순환 상태와 컨볼루션 상태를 갱신하므로 모든 가능한 경계에 스냅샷을 저장하기 어렵다. vLLM은 물리적 KDA 상태 블록과 세밀한 프리픽스 매칭을 분리하고, 블록 내부에 상태 스냅샷을 등록한 뒤 확장 전에 재사용 가능한 상태를 복사하는 방식을 택했다.
  • DSpark 추측 디코딩 지원: vLLM은 Inferact가 오픈소스로 공개한 Kimi K3용 DSpark speculator를 지원한다. 원문에 따르면 16개의 NVIDIA GB300 NVL72 GPU에서 추측 디코딩을 쓰지 않을 때 118 tok/s, DSpark를 사용할 때 370 tok/s를 기록해 약 3.14배 향상됐다.
  • 운영 기능까지 포함: prefill/decode 분리, Mooncake 기반 agentic KV caching, 도구 호출, reasoning 출력, 구조화 출력을 지원한다. NVIDIA Hopper와 Blackwell, AMD MI355X도 대상에 포함된다. 다만 의존성이 복잡해 현재는 Docker 이미지 사용이 전제된다.

의미와 영향

Kimi K3가 추론 프레임워크에 주는 부담은 단순한 모델 크기 증가가 아니다. 긴 컨텍스트, 순환형 선형 어텐션, full-attention, 희소 전문가 계산, 4비트 가중치, 추측 디코딩을 하나의 서비스 파이프라인에서 동시에 만족해야 한다.

따라서 vLLM의 day-0 지원은 최신 추론 엔진이 범용 Transformer 커널만으로는 부족하며, 모델 구조를 이해한 시스템 최적화가 필요하다는 점을 보여준다. 특히 하이브리드 프리픽스 캐싱은 표준 KV 캐시 중심 접근을 순환 상태를 가진 하이브리드 선형 모델로 확장한다는 점에서 주목할 만하다. vLLM은 이 핵심 변경이 Kimi K3와 유사한 다른 모델에도 도움이 될 것이라고 설명한다.

개발자에게는 Kimi K3를 실험할 수 있는 컨테이너 기반 경로와 구체적인 서빙 옵션이 마련됐다는 점이 단기적인 가치다. 더 넓게 보면 오픈웨이트 모델이 긴 컨텍스트와 비표준 어텐션을 더 많이 채택할수록, 추론 프레임워크의 경쟁은 “얼마나 많은 모델을 지원하는가”보다 “새로운 구조를 얼마나 빨리 효율적인 서비스로 전환하는가”로 이동할 가능성이 크다.

출처: vLLM Blog

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Runway의 Media Router, 생성형 미디어 경쟁을 ‘모델 오케스트레이션’으로 전환
추론·배포
cctest.ai
추론·배포

Runway의 Media Router, 생성형 미디어 경쟁을 ‘모델 오케스트레이션’으로 전환

Runway가 품질, 속도, 비용 기준으로 이미지·영상·오디오 생성 모델을 자동 선택하는 Media Router를 공개했다. 생성형 미디어 시장이 단일 모델 경쟁을 넘어 인프라와 라우팅 경쟁으로 이동하고 있음을 보여준다.

더 보기
CCTest · Blog
모델 라우팅은 단순한 모델 선택이 아니다: IBM Research가 본 엔터프라이즈 Agent의 현실
추론·배포
cctest.ai
추론·배포

모델 라우팅은 단순한 모델 선택이 아니다: IBM Research가 본 엔터프라이즈 Agent의 현실

IBM Research는 Agent 시스템의 모델 라우팅을 단순 분류 문제로 보면 한계가 있다고 지적한다. 실제 운영에서는 비용, 품질, 지연시간, 캐시, 인프라, 거버넌스가 함께 작동한다.

더 보기