아티클 목록으로
추론·배포

FreeToken, 소비자용 GPU에서 대규모 MoE 추론을 다시 설계하다

약 4분 소요

들어가며

대형 혼합 전문가(MoE) 모델을 로컬에서 실행하는 일은 GPU 메모리 용량만의 문제가 아니다. 희소 MoE는 토큰마다 일부 전문가만 활성화하지만, 필요한 가중치가 GPU 메모리와 시스템 RAM에 나뉘어 있을 수 있다. 따라서 가중치를 필요한 시점에 얼마나 빠르게 이동시키는지가 소비자용 PC의 성능을 좌우한다.

캘리포니아대학교 버클리와 MIT 연구진은 이 문제를 겨냥한 오픈소스 추론 엔진 FreeToken을 공개했다. 개인용 컴퓨터를 축소된 데이터센터로 보는 대신, 서로 다른 계산 자원을 상황에 맞게 조정하는 시스템으로 취급하는 것이 핵심 발상이다.

정적 오프로딩을 동적 스케줄링으로

기존 엣지 런타임은 CPU와 GPU 사이의 가중치 배치를 미리 정하는 경우가 많다. GPU에 필요한 전문가가 캐시되어 있지 않으면 PCIe를 통해 가중치를 가져올 때까지 실행이 멈춘다. 이 과정에서 GPU가 대기하고, 호스트 메모리 지연과 제한된 대역폭이 그대로 병목이 된다.

FreeToken은 이 구조를 q*라는 동적 협력 스케줄링 정책으로 바꾼다. 캐시 미스가 발생하면 현재 연결의 처리량을 바탕으로 토큰 계산을 CPU 코어와 GPU 텐서 코어에 나눠 배정한다. 또한 FTW라는 빠른 가중치 형식과 레이어 단위 더블 버퍼링을 사용해 가중치 전송과 다른 레이어의 계산을 겹치도록 설계했다. 실행 중 KV 캐시와 상주 전문가에 할당되는 GPU 메모리 비율을 조정하는 탄력적 메모리 관리자도 포함된다.

에이전트 워크로드를 위한 상태 재사용

코딩 보조 도구와 자율 에이전트는 한 번 입력한 문장을 그대로 처리하지 않는다. 프롬프트를 수정하고, 도구의 결과를 삽입하며, 새로운 사고 블록을 추가한다. 일반적인 선형 KV 캐시는 이런 변화가 발생하면 이전 계산의 넓은 부분을 무효화할 수 있다.

FreeToken은 논리적 작업 경계에 중간 어텐션 상태와 순환 활성값을 저장하는 의미 기반 앵커 체크포인트를 도입했다. 에이전트가 도구 인자를 수정하거나 외부 실행 결과를 삽입하더라도 영향을 받지 않은 부분 시퀀스를 재사용해 전체 프롬프트 재계산을 줄이는 것이 목표다. 다만 실제 효과는 작업 흐름에 재사용 가능한 경계가 얼마나 자주 나타나는지에 따라 달라진다.

벤치마크와 주의점

소재에 따르면 논문 벤치마크에서 8GB RTX 4060 노트북은 Qwen3.6-35B를 초당 약 39토큰으로 실행했다. RTX 5090 데스크톱에서는 284B 규모의 DeepSeek-V4-Flash를, 단일 워크스테이션 GPU에서는 753B 규모의 GLM-5.2를 평가했다. 현재 Linux와 Windows에서 NVIDIA RTX 30·40·50 시리즈를 지원하며, 명령줄 도구와 데스크톱 클라이언트를 제공한다.

다만 수치는 테스트 조건과 함께 봐야 한다. Ollama와 llama.cpp는 GGUF 양자화와 레이어 단위 오프로딩에 초점을 두고, vLLM과 SGLang은 고대역폭 데이터센터 환경을 주요 전제로 삼는다. 커뮤니티에서는 q*의 폐쇄형 계산이 CPU 스케줄링 지연, 메모리 경쟁, 여러 에이전트가 동시에 실행될 때의 전문가 상주 변화까지 충분히 반영하는지도 논의하고 있다.

의미와 영향

FreeToken의 의미는 특정 GPU에서 큰 모델이 작동한다는 주장에만 있지 않다. CPU, GPU, VRAM, 시스템 메모리를 하나의 자원 풀처럼 보고 로컬 추론을 협력적 스케줄링 문제로 재구성했다는 점이 중요하다. 이 방식이 다양한 환경에서 재현된다면 개발자는 보다 저렴하고 접근성 높은 하드웨어로 대형 MoE 애플리케이션의 일부를 실행하고, 클라우드 API 의존도를 낮출 수 있다.

앞으로는 공개 설정을 이용한 재현 실험, 동일 조건의 기준선 비교, 긴 컨텍스트와 에이전트 동시 실행에 대한 평가가 필요하다. 현재 FreeToken은 모든 대형 MoE 모델이 소비자용 노트북에서 실용적으로 구동된다는 증명이라기보다, 유망한 스케줄링 접근법으로 보는 편이 타당하다.

출처: InfoQ 中文

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물