아티클 목록으로
추론·배포

HyQuant, 혼합 정밀도로 LLM 어텐션과 KV 캐시 압축

약 4분 소요

개요

대규모 언어 모델 추론에서 저비트 양자화는 메모리와 계산 비용을 줄이는 대표적인 방법입니다. 하지만 어텐션, 특히 KV 캐시는 압축하기 까다로운 영역입니다. 컨텍스트가 길어질수록 캐시가 커지는 반면, 매우 낮은 비트 폭을 전체 상태에 일괄 적용하면 장문맥 이해와 추론 품질이 떨어질 수 있습니다.

HyQuant의 핵심 아이디어는 모든 어텐션 상태에 동일한 정밀도를 적용하지 않는 것입니다. 영향이 큰 위치는 높은 정밀도로 보호하고, 나머지 대규모 영역은 더 공격적으로 압축해 정확도 손실과 메모리 비용을 함께 관리하려고 합니다.

방법의 근거가 된 관찰

논문과 함께 제공된 설명에 따르면 Qwen3, Llama 3, Gemma 4, Qwen3.5 등의 어텐션 맵에서 반복적인 ‘수직선’ 패턴이 관찰됩니다. 이는 많은 Query 토큰이 반복해서 참조하는 소수의 Key 위치에 해당합니다. 제공 자료에서는 상위 5%의 Key 위치와 최근 128토큰으로 구성된 로컬 윈도우가 어텐션 질량의 약 82~86%를 포착한다고 설명합니다.

HyQuant는 이 관찰을 정밀도 배분에 활용합니다. 중요한 수직선 토큰과 최근 로컬 컨텍스트는 FP16으로 유지하고, 나머지 영역은 저비트 표현으로 바꿉니다. 즉, 컨텍스트 전체를 동일하게 양자화하기보다 어텐션이 집중되는 위치를 기준으로 정밀도를 차등 적용하는 방식입니다.

HyQuant의 동작 방식

  • 핵심 영역 선택: 수직선 인지형 어텐션 패턴 신호를 이용해 높은 정밀도를 유지할 토큰을 찾습니다. 설명된 선택 비용은 전체 실행 시간의 약 3~5%입니다.
  • Prefill 단계: 입력 컨텍스트를 처리할 때 선택된 수직선 토큰과 로컬 슬라이딩 윈도우는 FP16으로 유지하고, 나머지 상태를 양자화합니다.
  • Decode 단계: 생성 과정에서는 같은 원칙을 KV 캐시에 적용합니다. 역양자화와 어텐션 계산을 융합해 추가적인 메모리 이동을 줄입니다.
  • 전용 커널: Prefill과 Decode 모두에 혼합 정밀도 연산을 적용해, 양자화로 얻은 메모리 이점이 구현 오버헤드로 상쇄되는 문제를 줄이려 합니다.

보고된 실험 결과

단일 H100에서의 결과로, 제공 자료는 32K 컨텍스트에서 HyQuant Decode 커널이 FlashAttention-2보다 최대 3.58배 빠르다고 보고합니다. 다만 엔드투엔드 Decode 속도 향상은 1.04~1.17배로 더 작습니다. 이는 커널 수준의 개선이 전체 시스템 성능으로 동일하게 이어지지는 않는다는 점을 보여줍니다.

Qwen3-8B의 thinking mode에서는 LongBench 평균 점수가 HyQuant 45.04, FlashAttention-2 44.59로 제시됩니다. 자료에 포함된 KIVI, SageAttention, KVTuner의 점수는 37.7~40.5입니다. 또한 32K 프리픽스와 배치 크기 16 조건에서 HyQuant는 231.6 token/s로 실행됐지만, 비교 대상으로 제시된 방법들은 메모리 부족을 겪었다고 보고됩니다. Qwen3-32B, Llama 3.1-8B, GLM-4-9B에서도 유사한 경향이 나타났다고 설명됩니다.

의미와 한계

HyQuant의 의미는 어텐션 양자화를 단순한 일괄 정밀도 축소가 아니라 중요도 기반 정밀도 할당 문제로 바라본 데 있습니다. 적은 고정밀 영역으로 중요한 상태를 보호하면서 대부분의 상태를 저비트로 저장할 수 있어, KV 캐시가 주요 메모리 부담이 되는 장문맥 서비스에 특히 적합할 가능성이 있습니다.

다만 제시된 수치는 특정 모델과 작업, 컨텍스트 길이, 단일 H100 환경에서 얻은 결과입니다. 모든 하드웨어와 워크로드에서 동일한 속도 향상이 보장된다는 의미는 아닙니다. 실제 배포에서는 핵심 토큰 선택 비용, 커널 지원 범위, 모델과 작업에 따른 어텐션 패턴의 안정성도 추가로 확인해야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
병목을 따라가다: AMD MI355X에서 MiniMax M3를 최적화한 방법
추론·배포
cctest.ai
추론·배포

병목을 따라가다: AMD MI355X에서 MiniMax M3를 최적화한 방법

vLLM은 AMD Instinct MI355X에서 MiniMax M3의 성능을 높인 과정을 공개했다. 핵심은 단일 커널을 찾는 것이 아니라 로컬 텐서 형태, 중복 계산, 데이터 이동, 디스패치, 대기열을 차례로 점검하며 이동하는 병목을 추적하는 것이다.

더 보기