아티클 목록으로
추론·배포

LLM의 Prefill과 Decode를 따로 양자화하는 DQ

약 3분 소요

LLM 추론은 하나의 연속된 과정처럼 보이지만 Prefill과 Decode의 하드웨어 특성은 크게 다릅니다. Prefill은 긴 입력 프롬프트의 여러 토큰을 한 번에 처리하므로 연산 처리량이 중요합니다. 반면 Decode는 토큰을 하나씩 생성하기 때문에 가중치 이동량과 메모리 대역폭이 주요 병목이 됩니다.

논문 ‘Disaggregated Quantization: Specializing LLM Prefill and Decode’는 이러한 차이를 양자화 설계에 반영한 Disaggregated Quantization(DQ)을 제안합니다. 하나의 양자화 체크포인트를 모든 단계에 적용하는 대신, Prefill과 Decode에 서로 다른 계산 형식, 가중치 정밀도, 저장 위치를 배정하는 방식입니다.

DQ의 핵심 구성

  • Prefill은 연산 효율을 우선합니다. 긴 프롬프트를 처리할 때 저정밀도 연산을 더 효과적으로 활용할 수 있도록 계산에 특화된 Prefill 가중치를 별도로 학습합니다.
  • Decode는 메모리 효율을 우선합니다. 생성 단계에서는 작게 압축된 저비트 가중치를 사용해 토큰마다 발생하는 가중치 전송량을 줄입니다.
  • 활성값 양자화를 단계별로 다르게 적용합니다. Qwen 3와 Gemma 3 실험에서 Decode에만 활성값 양자화를 제거하자 추론 비용을 늘리지 않고 Decode 중심 작업의 정확도가 향상됐습니다.
  • 기존 양자화 체크포인트와도 결합할 수 있습니다. 공유 가중치 형식의 분리와 포스트트레이닝 양자화를 통해 더 큰 모델에 대한 적용 가능성도 검토했습니다.

실험에서 별도로 학습한 Prefill 가중치는 weight-only 추론보다 프롬프트 처리를 빠르게 하면서, 2~3비트 Decode 설정에서 비슷하거나 더 높은 정확도를 보였습니다. Qwen3.8-27B용으로 공개된 NVFP4 Prefiller는 Decode 체크포인트를 수정하지 않고 MMLU-Pro와 MMMU-Pro의 저비트 성능을 개선했습니다. 이는 양자화의 품질이 단순한 비트 수뿐 아니라 해당 표현이 어느 추론 단계의 메모리 접근과 연산 패턴에 맞는지에도 달려 있음을 보여줍니다.

단일 장치 배포를 위한 ODP

별도의 Prefill 체크포인트를 추가하면 GPU 메모리와 저장 공간 부담이 커집니다. 연구진은 이를 해결하기 위해 Offloaded Disaggregated Prefill(ODP)을 제안했습니다. Prefill 가중치를 SSD에 저장하고 긴 프롬프트를 처리하는 동안 스트리밍해, 추가 로딩 비용을 입력 길이에 걸쳐 분산시키는 방식입니다.

동일한 27B 모델을 llama.cpp에서 평가한 결과, 8K 프롬프트 길이에서 ODP는 weight-only 기준선보다 time-to-first-token을 1.78배 개선했습니다. 다만 이 효과가 모든 환경에서 동일하게 나타나는 것은 아닙니다. 프롬프트 길이, SSD 처리량, 스케줄링 방식, 모델 구조가 결과에 영향을 줍니다. 입력이 짧다면 추가 가중치 로딩 비용이 이점을 줄일 수도 있습니다.

의미와 과제

DQ는 양자화를 모델 전체에 고정하는 선택에서 추론 시스템 단위의 설계 문제로 확장합니다. Prefill에서는 연산 자원 활용을, Decode에서는 메모리 전송 최소화를 우선함으로써 긴 문맥 서비스와 Decode 중심 애플리케이션에 새로운 절충안을 제공합니다.

그러나 운영 복잡성은 늘어납니다. 여러 체크포인트를 관리하고, vLLM이나 llama.cpp 같은 런타임에서 가중치 로딩과 단계 전환을 제어해야 합니다. 실제 배포에서는 GPU 종류, 입력 길이 분포, 저장장치 성능, 서비스 스케줄링을 함께 검증해야 합니다. DQ는 모든 환경을 자동으로 개선하는 만능 해법이라기보다, 추론 단계별 특성을 활용하는 시스템 최적화 전략에 가깝습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
계속 생각하는 것만으로는 부족하다: 작은 추론 모델에 도움을 요청하는 법을 가르친 FlyBy
추론·배포
cctest.ai
추론·배포

계속 생각하는 것만으로는 부족하다: 작은 추론 모델에 도움을 요청하는 법을 가르친 FlyBy

KAIST AI 연구는 자기 성찰을 오래 수행해도 소형 추론 모델이 도달할 수 있는 해답의 범위가 반드시 넓어지지는 않는다고 분석했다. FlyBy는 지식 부족이 감지될 때만 더 강한 모델에 질의한다.

더 보기
CCTest · Blog
HybridInfer, 스마트폰 열 여유를 반영한 LLM 라우팅 제안
추론·배포
cctest.ai
추론·배포

HybridInfer, 스마트폰 열 여유를 반영한 LLM 라우팅 제안

HybridInfer는 실제 안드로이드 기기에서 온디바이스·엣지·클라우드 LLM을 동적으로 선택하는 강화학습 라우터입니다. 모바일 추론의 문제는 단순한 속도 저하가 아니라, 연속 생성으로 인한 런타임 불안정일 수 있다고 지적합니다.

더 보기