아티클 목록으로
추론·배포

SSD를 ‘메모리 계층’으로 쓰는 Colibrì, 거대 MoE 모델을 일반 PC에서 실행

약 3분 소요

들어가며

초대형 언어 모델을 로컬에서 실행할 때 가장 큰 문제는 연산 성능만이 아닙니다. 수천억에서 수조 개에 이르는 파라미터를 일반 PC의 RAM이나 GPU 메모리에 모두 담을 수 있느냐가 핵심입니다. 오픈소스 프로젝트 Colibrì는 다른 접근을 제시합니다. 모델 전체를 고속 메모리에 상주시킨 뒤 계산하는 대신, 당장 사용하지 않는 가중치는 NVMe SSD에 두고 필요한 순간에만 읽어옵니다.

Colibrì는 순수 C로 구현됐으며 별도의 추론 엔진에 의존하지 않습니다. 제공된 자료에 따르면 여러 모델 계열을 지원하고, 744B 파라미터 규모의 GLM-5.2 실험을 계기로 개발됐습니다. GitHub 저장소는 수만 개의 Star를 확보했습니다.

MoE 모델의 희소성을 활용

이 방식이 가능한 배경에는 Mixture-of-Experts, 즉 MoE 구조가 있습니다. MoE 모델은 전체 파라미터 수가 매우 크더라도 토큰을 생성할 때 전체를 한꺼번에 계산하지 않습니다. 자료에 소개된 GLM-5.2는 총 744B 파라미터를 갖지만 토큰당 실제 활성화되는 규모는 약 40B입니다.

Colibrì는 모델을 다음과 같이 여러 저장 계층으로 나눕니다.

  • Attention, Embedding, 공유 전문가처럼 매번 필요한 구성 요소는 RAM에 상주시킵니다. GLM-5.2 int4 구성에서는 약 9.9GB입니다.
  • 대규모 라우팅 전문가 가중치는 주로 SSD에 저장합니다.
  • Router가 선택한 전문가만 RAM으로 읽어오며, GPU가 있으면 VRAM도 활용합니다.

이는 모델 가중치에 적용한 JIT 로딩과 비슷합니다. 전문가가 어느 저장 계층에 놓이는지는 처리 속도에 영향을 주지만 Router의 선택이나 가중치 자체를 바꾸지는 않습니다. 메모리가 작다는 이유로 일부 전문가를 임의로 제거하는 방식도 아닙니다.

성능은 캐시와 프리페칭에 달렸다

토큰을 생성할 때마다 SSD에서 전문가를 읽으면 속도는 크게 떨어집니다. Colibrì는 LRU 캐시로 최근 사용된 전문가를 RAM에 남기고, 실행 중 사용 빈도를 기록해 자주 선택되는 전문가에 더 높은 캐시 우선순위를 부여합니다.

현재 계층을 계산하는 동안 다음 계층에서 사용될 가능성이 높은 전문가를 미리 읽는 기능도 제공합니다. 자료는 인접 계층의 라우팅 사이에 일정한 상관관계가 있으며, 전문가 예측 가능성이 71.6%에 이른다고 설명합니다. SSD 두 대를 사용해 모델 복사본과 읽기 작업을 분산하는 방식도 지원합니다.

프로젝트가 제시한 테스트에서는 RAM 25GB 환경의 콜드 캐시 속도가 약 0.050.1 token/s였습니다. RAM 128GB의 CPU 전용 시스템은 약 1.8 token/s, 6장의 RTX 5090을 사용해 더 많은 전문가를 고속 계층에 상주시킨 구성은 약 5.86.8 token/s를 기록했습니다. 다만 이는 특정 조건에서 나온 프로젝트 측정값이며 모든 하드웨어에 적용되는 보편적 벤치마크는 아닙니다.

의미와 한계

Colibrì가 SSD를 GPU 메모리만큼 빠르게 만드는 것은 아닙니다. 대신 SSD는 전체 모델을 담는 공간, RAM은 넓은 캐시, VRAM은 가장 자주 사용되는 가중치를 처리하는 고속 계층으로 역할을 나눕니다. 이 구조는 거대 모델을 실험하는 데 필요한 메모리 장벽을 낮출 수 있습니다.

그러나 초기 로딩 시간과 콜드 캐시 지연, 지속적인 생성 속도는 SSD 대역폭, RAM 용량, 전문가 재사용률, 모델 구조에 따라 크게 달라집니다. 따라서 Colibrì는 고처리량 상용 서버의 대체재라기보다, 소비자용 하드웨어에서 초대형 모델을 검증할 수 있게 하는 흥미로운 시스템 설계로 보는 편이 정확합니다.

출처: 양자位

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
vLLM, 최전선 성능과 이식성을 위한 하드웨어 비종속 레이어 도입
추론·배포
cctest.ai
추론·배포

vLLM, 최전선 성능과 이식성을 위한 하드웨어 비종속 레이어 도입

vLLM이 최신 GPU에 맞춘 플랫 모델을 확대하는 동시에 구형 GPU와 외부 가속기를 지원하기 위한 하드웨어 비종속 레이어를 구축합니다. H100에서는 최근 3개 모델의 기하평균 기준 총 토큰 처리량이 네이티브 구현과 3.4% 이내의 차이를 보였습니다.

더 보기