아티클 목록으로
추론·배포

Qwen 3.8 27B, Cerebras 공개 엔드포인트에서 약 1,500 tokens/s

약 3분 소요

들어가며

Cerebras의 공개 모델 목록에 Qwen 3.8 27B가 추가됐다. API 모델 ID는 qwen-3.8-27b이며, 모델 규모는 270억 파라미터로 표시돼 있다. 카탈로그가 제시하는 생성 속도는 약 1,500 tokens/s다. 무료 체험 계층과 종량제 계층 모두에서 이용할 수 있지만, 실제 호출에는 각 계층의 속도 제한과 가격 정책이 적용된다.

핵심 내용

  • 공개 API로 제공: 별도의 추론 인프라를 직접 구축하지 않고 Cerebras의 공유 엔드포인트에서 모델을 시험할 수 있다.
  • 계층별 컨텍스트 한도: 무료 계층은 64K, 유료 계층은 128K로 안내된다. 세부적인 호출 제한과 과금 조건은 별도 문서에서 확인해야 한다.
  • 속도는 참고값: 약 1,500 tokens/s는 모델 목록에 표시된 수치다. 입력·출력 길이, 동시 요청, 네트워크, 계정 계층에 따라 실제 결과는 달라질 수 있다.
  • 공개 모델은 가지치기하지 않음: Cerebras는 공개 엔드포인트에서 원본 비가지치기 모델을 제공한다고 밝혔다. REAP 가지치기 모델은 연구와 실험을 위해 Hugging Face에서 제공되며 공유 API에는 올라오지 않는다.
  • 저장 단계의 선택적 양자화: 가중치는 16비트, 8비트, 4비트 표현을 조합해 저장할 수 있다. 품질에 민감한 계층은 더 높은 정밀도를 유지하고 실행 중 역양자화한다. 활성값, 어텐션, KV 캐시는 양자화하지 않는다.

의미와 영향

이번 추가는 Cerebras 공개 서비스에서 선택할 수 있는 언어 모델의 폭을 넓힌다. 개발자는 직접 모델을 배포하고 운영하는 부담을 줄이면서 대화형 애플리케이션, 프로토타입, 배치 실험, 모델 비교 작업을 진행할 수 있다. 약 1,500 tokens/s라는 표기 역시 빠른 응답을 요구하는 사용 사례를 검토할 때 참고할 수 있는 요소다.

다만 생성 속도가 곧 전체 응답 지연을 의미하지는 않는다. 첫 토큰이 나오는 시간, 대기열, 네트워크 왕복, 출력 길이, 동시성 등이 사용자 경험에 영향을 준다. 무료 계층에는 속도 제한도 있으므로, 운영 환경에 도입하기 전에는 지속 처리량, 동시 요청, 오류 재시도, 긴 컨텍스트 사용 패턴을 실제로 측정하는 편이 안전하다.

압축 정책을 구체적으로 공개한 점도 눈여겨볼 만하다. 양자화는 숫자의 표현 정밀도를 줄이는 방식인 반면, 가지치기는 모델의 일부를 제거해 구조적으로 다른 모델을 만든다. Cerebras는 두 개념을 구분하고, 공개 엔드포인트의 아키텍처를 예고 없이 변경하지 않겠다고 설명한다. 그러나 제공 문서에는 Qwen 3.8 27B의 독립적인 품질 벤치마크가 없으므로, 최종 선택은 실제 업무 데이터와 작업을 기준으로 검증해야 한다.

출처: Hacker News

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
CRISP, 구조 인식 라우팅으로 장문맥 희소 프리필 개선
추론·배포
cctest.ai
추론·배포

CRISP, 구조 인식 라우팅으로 장문맥 희소 프리필 개선

CRISP는 입력에 따라 달라지는 희소 어텐션을 위해 프록시 어텐션 맵에서 구조를 직접 읽는 지표와 sink를 고려한 임계값을 제안합니다. 이를 통해 동적 라우팅 비용과 긴 문맥에서 누적되는 배경 노이즈를 함께 줄이는 것이 목표입니다.

더 보기