아티클 목록으로
추론·배포

FreeToken, 개인용 PC를 대규모 MoE 추론 플랫폼으로 전환

약 3분 소요

들어가며

오픈 웨이트 모델의 성능은 빠르게 높아지고 있지만, 이를 서비스하는 방식은 여전히 데이터센터 GPU를 전제로 하는 경우가 많습니다. 개인용 PC에서는 GPU 메모리 용량뿐 아니라 시스템 메모리 대역폭, CPU와 GPU 사이의 데이터 이동, 에이전트가 축적하는 실행 상태가 병목이 될 수 있습니다. FreeToken은 개인용 컴퓨터를 성능이 낮은 GPU로 취급하지 않고, 여러 하드웨어 자원을 런타임에 조합하는 탄력적 추론 플랫폼으로 바라봅니다.

핵심 내용

  • MoE 특성에 맞춘 전체 서빙 스택. 모델 배치와 로딩, 전문가 상주, CPU-GPU 실행, 에이전트 상태 재사용, 런타임 메모리 관리까지 하나의 시스템으로 설계합니다.
  • 대역폭에 따른 동적 배치. PC마다 GPU 메모리, 시스템 메모리, CPU 성능, 전송 대역폭의 균형이 다릅니다. FreeToken은 CPU와 GPU의 역할을 고정하지 않고, 실제로 사용 가능한 자원에 계산과 모델 상태를 계속 매핑합니다.
  • 변화하는 에이전트 작업을 고려. 코딩 에이전트와 도구 사용 에이전트는 세션 중 실행 패턴이 달라질 수 있습니다. 이에 따라 전문가 접근과 상태 요구도 변할 수 있으며, FreeToken은 이를 런타임 문제로 다루고 상태 재사용을 지원합니다.
  • 로컬 실행 범위 확대. 8GB GPU 노트북부터 단일 워크스테이션 GPU까지 20개 이상의 MoE 모델을 지원합니다. 논문이 제시한 사례에는 노트북의 35B 모델, 게이밍 데스크톱의 284B 모델, 단일 워크스테이션 GPU의 753B GLM-5.2가 포함됩니다.

의미와 영향

FreeToken의 핵심은 단순히 작은 장치에 더 큰 모델을 넣는 데 있지 않습니다. 모델 전체를 GPU 메모리에 상주시킬 수 없다면 어떤 전문가를 남겨둘지, 어떤 상태를 재사용할지, CPU와 다른 메모리 자원을 언제 실행에 참여시킬지를 결정해야 합니다. MoE는 토큰마다 일부 전문가만 활성화하지만, 전문가 가중치를 이동하는 비용은 여전히 응답 속도를 좌우할 수 있습니다. 따라서 고정된 분할보다 실행 중 자원 배치가 중요해질 수 있습니다.

이 접근은 오픈 웨이트 모델을 “다운로드할 수 있는 모델”에서 “로컬에 배포할 수 있는 소프트웨어”로 확장하는 데 의미가 있습니다. 다만 제공된 자료에는 동일 조건에서 측정한 처리량, 첫 토큰 지연시간, 생성 속도, 전력 소비 비교가 없습니다. 따라서 제시된 모델 규모는 모든 개인용 PC에서 보장되는 성능이라기보다 시스템이 겨냥하는 서빙 범위를 보여주는 사례로 해석해야 합니다. 실제 결과는 모델과 하드웨어 구성, 작업 유형에 따라 달라질 수 있습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
폐기 GPU의 두 번째 삶, DumpsterCluster로 LLaMA-70B 추론하기
추론·배포
cctest.ai
추론·배포

폐기 GPU의 두 번째 삶, DumpsterCluster로 LLaMA-70B 추론하기

DumpsterCluster 연구는 퇴역 GPU를 묶어 대규모 언어 모델 추론 시스템으로 활용할 수 있음을 보여준다. 그러나 낮은 구매 비용만으로는 충분하지 않으며, 전기요금과 전력의 탄소집약도가 실제 경제성과 지속가능성을 결정한다.

더 보기
CCTest · Blog
AI 크레딧 재판매 시장과 토큰 브로커의 부상
추론·배포
cctest.ai
추론·배포

AI 크레딧 재판매 시장과 토큰 브로커의 부상

한 보안 연구 글은 스타트업이 쓰지 못한 AI API 크레딧을 사들여 할인된 추론 접근권으로 되파는 ‘토큰 브로커’ 시장을 추적했다. 추론 자원이 일종의 준화폐처럼 유통되면서 비용 절감과 함께 보안·컴플라이언스 리스크도 커지고 있다.

더 보기
CCTest · Blog
LiveAnimate: 실시간 장편 인물 애니메이션을 가능하게 하다
추론·배포
cctest.ai
추론·배포

LiveAnimate: 실시간 장편 인물 애니메이션을 가능하게 하다

LiveAnimate는 포즈 기반 인물 애니메이션의 오래된 딜레마, 즉 좋은 품질과 느린 속도 사이의 충돌을 다룬다. 14B 규모의 비디오 DiT를 실시간 스트리밍 추론에 맞게 재구성해 긴 시퀀스에서도 안정성을 유지하려는 점이 핵심이다.

더 보기