아티클 목록으로
추론·배포

4비트 LLM을 회복하는 방법: QAT의 함정을 피한 QAH

약 3분 소요

대규모 언어 모델을 저렴하게 서비스하려면 대개 두 단계의 압축을 거친다. 먼저 파라미터 수를 줄여 모델 구조를 축소하고, 남은 가중치를 낮은 비트로 표현한다. 이 조합은 메모리와 서빙 비용을 낮추지만 추론, 수학, 코드 생성, 장문맥 처리 같은 능력을 동시에 훼손할 수 있다. 그래서 배포 전에는 압축된 모델을 새로운 구조와 수치 표현에 적응시키는 ‘회복’ 또는 ‘힐링’ 단계가 필요하다.

가장 일반적인 선택지는 양자화 인지 학습(QAT)이다. 학습 중 저비트 가중치를 시뮬레이션하고, 압축 모델을 하드 라벨에 맞춰 다시 학습한다. 그러나 이번 연구의 파이프라인에서는 QAT가 느리게 수렴했고, 최고 성능을 지난 뒤 결과가 무너지는 현상이 나타났다. 실제 배포에서 중요한 것은 한 번의 최고 점수만이 아니다. 계속 학습하거나 파이프라인을 재실행해도 성능을 유지할 수 있는지가 운영 가능성을 좌우한다.

연구진은 교사 모델의 선택에도 구조적인 한계가 있다고 본다. 구조적으로 압축된 모델은 완전한 정밀도로 독립 학습된 모델이 아니다. 해당 모델의 bfloat16 체크포인트 역시 원본 모델에서 회복된 근사치에 가깝다. 따라서 4비트 학생이 이 중간 모델만을 목표로 삼으면, 중간 모델이 이미 잃어버린 능력까지 그대로 물려받을 수 있다.

Quantization-Aware Healing(QAH)은 학습 목표를 바꾼다. QAH는 압축 후의 중간 모델이 아니라 원본 비압축 모델에서 4비트 학생 모델로 직접 지식을 증류한다. 학생은 교사의 출력 분포를 학습하는 동시에, 줄어든 파라미터 수와 양자화된 가중치라는 제약에 적응해야 한다. 이는 단순히 정답 라벨을 다시 맞추는 방식보다 압축으로 인한 능력 손실을 복원하는 목적에 가깝다.

실험은 GPT-OSS 120B를 60B로 줄인 뒤 MXFP4로 양자화하는 흐름으로 구성됐다. 공개된 학생 모델 Hypernova-60B는 교사 모델의 절반 수준인 파라미터를 사용하며, 가중치 메모리는 약 4분의 1로 줄였다. 9개 벤치마크 중 7개에서 bfloat16 원본 모델과 동등하거나 더 높은 결과를 기록했다. 이것이 저비트 모델이 모든 상황에서 전정밀도 모델을 능가한다는 뜻은 아니지만, 압축 손실이 항상 되돌릴 수 없는 것은 아니라는 점을 보여준다.

핵심 내용:

  • QAH는 원본 비압축 모델을 증류 교사로 사용한다.
  • 비교 대상인 QAT보다 비슷한 최고점에 약 7배 빠르게 도달했다.
  • 추가 학습에서도 안정적으로 유지돼 수동 조기 종료에 대한 의존을 줄인다.
  • 분산 학습 백엔드에 따라 재현 가능한 큰 품질 차이가 발생할 수 있다.

이 연구의 실용적 의미는 특정 모델의 점수보다 배포를 위한 회복 절차를 제시했다는 데 있다. 여러 학습률과 스케줄을 장기간 시험하면서 우연히 좋은 체크포인트를 찾는 부담을 줄이는 것이 목표다. 논문 관련 논의에서 저자들은 원본 모델 제공자의 전체 학습 코퍼스를 확보하지 못하는 경우가 많으며, 고품질 공개 데이터와 태스크별 데이터를 조합해 QAH를 적용했다고 설명했다. 다만 이는 여러 오픈소스 모델에서 얻은 실무 경험이며, 모든 모델과 데이터 조건에 대한 보편적 보장은 아니다.

도입을 검토하는 팀은 최고 벤치마크 점수만 보지 말고 지속 학습 안정성, 데이터 구성의 영향, 분산 학습 백엔드 차이, 실제 업무 데이터에서의 성능을 함께 평가해야 한다. QAH는 4비트 LLM 회복을 위한 유망한 레시피지만, 아키텍처와 압축 비율이 달라졌을 때의 효과는 추가 검증이 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델
추론·배포
cctest.ai
추론·배포

Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델

Daedalus-150M은 대형 모델을 축소한 뒤 CPU에 맞추는 대신, 4비트 가중치와 단일 사용자·토큰 단위 생성을 먼저 정하고 구조를 선택한 소형 언어 모델입니다. 18개 블록 중 12개를 짧은 합성곱으로 구성해 긴 문맥에서 KV 캐시를 반복해서 읽는 비용을 줄였습니다.

더 보기