아티클 목록으로
프레임워크·도구

오픈소스 Strata, 소비자용 PC에서 1250억 파라미터 모델 실행

약 3분 소요

들어가며

대규모 언어 모델은 지금까지 주로 클라우드 서버에서 사용하는 기술로 여겨졌다. 오픈소스 프로젝트 Strata는 이 모델을 개인용 하드웨어로 가져오는 방법을 제시한다. Windows와 Linux 환경에서 약 1250억 파라미터 규모의 Qwen3.8-Flash-Next를 실행할 수 있도록 모델, 추론 엔진, 설치 스크립트와 호환 API를 함께 제공한다. 12GB 이상의 VRAM을 갖춘 PC가 대상이며, 대화와 코드, 이미지 입력을 외부 서비스로 보내지 않고 로컬에서 처리할 수 있다.

다만 프로젝트 제목에 등장하는 ‘초당 100토큰’은 모든 소비자용 PC에 적용되는 보편적인 수치가 아니다. 공개된 측정 결과는 그래픽카드, 시스템 RAM, 양자화 형식, 컨텍스트 길이에 따라 크게 달라진다.

핵심 내용

  • 게이밍 GPU를 겨냥한다: 지원 목록에는 일부 NVIDIA RTX 20~50 시리즈와 여러 AMD Radeon 제품이 포함된다. 권장 기준은 VRAM 12GB 이상과 시스템 RAM 32GB 이상이며, 64GB면 설치 프로그램이 제공하는 주요 모델 구성을 선택하기 쉽다.
  • 양자화가 속도와 품질을 좌우한다: RAM 64GB와 RTX 5070 조합에서는 Q2_0이 초당 약 94토큰, IQ3_S가 약 53토큰으로 측정됐다. RX 9070 XT에서는 각각 약 60토큰과 44토큰이었다. 더 강한 압축은 속도를 높일 수 있지만 모델 능력과 절충이 필요하다.
  • 채팅 이상의 활용이 가능하다: 브라우저 채팅 화면과 실행 모니터, 이미지 입력을 제공하며 OpenAI 호환 엔드포인트도 지원한다. 코드 에이전트와 다른 애플리케이션에 연결할 수 있고, 기본적으로 한 번에 하나의 요청을 처리한다. 병렬 처리 수도 설정할 수 있다.
  • 시스템 RAM의 부담이 크다: 첫 실행 때 약 3555GB의 데이터를 로드하며, 13분 동안 PC가 느려질 수 있다. 모델 다운로드 용량은 약 70GB이고, 시작 시간을 줄이려면 SSD가 권장된다.
  • 메모리 용량에 따라 모델을 골라야 한다: 32GB 시스템에는 코드 특화 Coder, 48GB 안팎에는 IQ2_XS, 64GB에는 IQ3_XXS나 IQ3_S가 후보가 된다. 더 높은 품질의 버전은 추가 RAM이나 SSD 접근을 요구해 속도가 떨어질 수 있다.

의미와 한계

Strata의 의미는 모든 사용자가 전용 추론 서버와 같은 성능을 얻는다는 데 있지 않다. 저비트 양자화를 활용해 대형 모델을 VRAM과 시스템 RAM에 나누어 올리고, 필요하면 SSD에서도 일부를 읽는 구조를 개인 환경에 적용했다는 점이 핵심이다. 코딩 에이전트, 오프라인 문서 처리, 민감한 데이터를 다루는 작업에서는 클라우드 API 의존도를 줄이는 방법이 될 수 있다.

그러나 로컬 실행에도 분명한 비용이 따른다. 다운로드 용량이 크고, 첫 로딩 과정에서 많은 메모리를 사용하며, 긴 컨텍스트를 처음 읽는 데 상당한 시간이 걸릴 수 있다. 사양이 낮은 PC는 더 강하게 압축된 모델을 선택해야 한다. AMD GPU의 이미지 입력은 Windows에서 제한이 있고, 멀티 GPU와 구형 하드웨어 지원도 실험적이다. 설치 전에는 VRAM, RAM, 드라이버, 디스크 여유 공간을 확인해야 하며, 공개된 속도는 특정 테스트 환경의 참고값으로 이해하는 편이 안전하다.

결국 Strata는 모델과 실행 환경을 묶은 개발자용 로컬 추론 도구에 가깝다. 메모리 용량과 양자화 기술이 발전하면 코드 에이전트와 개인정보 중심의 AI 작업이 클라우드에서 개인 워크스테이션으로 이동하는 흐름을 더욱 촉진할 수 있다.

Hacker News

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
RayOrch, 멀티모달 데이터 준비에 계보 기반 병렬 처리 도입
프레임워크·도구
cctest.ai
프레임워크·도구

RayOrch, 멀티모달 데이터 준비에 계보 기반 병렬 처리 도입

RayOrch는 문서와 동영상을 가변적인 하위 작업으로 확장하는 파이프라인을 위해 설계된 프로그래밍 모델이자 분산 실행 엔진입니다. 부모-자식 관계와 순서를 유지하면서 여러 부모의 준비된 작업을 GPU 배치로 묶습니다.

더 보기
CCTest · Blog
자연어 사양을 로컬 신경 함수로 바꾸는 Compile by Training
프레임워크·도구
cctest.ai
프레임워크·도구

자연어 사양을 로컬 신경 함수로 바꾸는 Compile by Training

Compile by Training은 교사 모델이 생성한 작업별 예제로 경량 어댑터를 학습해 자연어 사양을 재사용 가능한 로컬 신경 함수로 변환합니다. 어려운 벤치마크에서 정확도를 높였지만 컴파일 시간과 예제 커버리지라는 새로운 비용도 발생합니다.

더 보기