아티클 & 가이드

추론·배포

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 29개의 아티클

CCTest · Blog
ParaTempo, 시간적 신뢰도로 병렬 추론을 동적으로 최적화
추론·배포
cctest.ai
추론·배포

ParaTempo, 시간적 신뢰도로 병렬 추론을 동적으로 최적화

ParaTempo는 각 추론 분기가 시간에 따라 답안 공간에서 얼마나 수렴하는지 추적하는 학습 불필요 비동기 병렬 추론 프레임워크입니다. 수렴도가 낮은 경로는 제거하고, 안정된 경로는 일찍 종료하며, 남은 계산을 새로운 분기에 재배분합니다.

더 보기
CCTest · Blog
Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델
추론·배포
cctest.ai
추론·배포

Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델

Daedalus-150M은 대형 모델을 축소한 뒤 CPU에 맞추는 대신, 4비트 가중치와 단일 사용자·토큰 단위 생성을 먼저 정하고 구조를 선택한 소형 언어 모델입니다. 18개 블록 중 12개를 짧은 합성곱으로 구성해 긴 문맥에서 KV 캐시를 반복해서 읽는 비용을 줄였습니다.

더 보기
CCTest · Blog
Llama-Mobile, 2.7비트 양자화로 모바일 VLM 배포에 도전
추론·배포
cctest.ai
추론·배포

Llama-Mobile, 2.7비트 양자화로 모바일 VLM 배포에 도전

Llama-Mobile은 제한된 메모리와 연산 자원을 가진 모바일 기기에서 비전-언어 모델을 실행하기 위한 양자화 프레임워크를 제안합니다. 모델이 직접 생성한 데이터와 Arm CPU 실행을 고려한 2.7비트 형식을 활용해 Llama 3.2 11B Vision Instruct를 3.7GB로 줄이면서 표준 시각 질의응답 성능을 유지했습니다.

더 보기
CCTest · Blog
FlashPrefill V2, 장문맥 LLM 프리필을 실서비스에 가깝게
추론·배포
cctest.ai
추론·배포

FlashPrefill V2, 장문맥 LLM 프리필을 실서비스에 가깝게

FlashPrefill V2는 평균 보정항, GPU 중심의 희소 어텐션 커널, 페이지드 KV 캐시와 연속 배치 지원을 결합해 장문맥 LLM 프리필을 실서비스 환경에 맞게 개선한다. NVIDIA H20의 128K 문맥에서 FP8 기준 FlashAttention-2 대비 최대 47.26배의 속도 향상을 보고했다.

더 보기
CCTest · Blog
FreeToken, 개인용 PC를 대규모 MoE 추론 플랫폼으로 전환
추론·배포
cctest.ai
추론·배포

FreeToken, 개인용 PC를 대규모 MoE 추론 플랫폼으로 전환

FreeToken은 서로 다른 개인용 하드웨어에서 대규모 Mixture-of-Experts 모델을 실행하기 위한 엣지 네이티브 서빙 시스템입니다. PC를 작은 GPU로 보는 대신 CPU, GPU, 메모리와 모델 상태를 통합하는 탄력적 추론 플랫폼으로 다룹니다.

더 보기
CCTest · Blog
폐기 GPU의 두 번째 삶, DumpsterCluster로 LLaMA-70B 추론하기
추론·배포
cctest.ai
추론·배포

폐기 GPU의 두 번째 삶, DumpsterCluster로 LLaMA-70B 추론하기

DumpsterCluster 연구는 퇴역 GPU를 묶어 대규모 언어 모델 추론 시스템으로 활용할 수 있음을 보여준다. 그러나 낮은 구매 비용만으로는 충분하지 않으며, 전기요금과 전력의 탄소집약도가 실제 경제성과 지속가능성을 결정한다.

더 보기
CCTest · Blog
AI 크레딧 재판매 시장과 토큰 브로커의 부상
추론·배포
cctest.ai
추론·배포

AI 크레딧 재판매 시장과 토큰 브로커의 부상

한 보안 연구 글은 스타트업이 쓰지 못한 AI API 크레딧을 사들여 할인된 추론 접근권으로 되파는 ‘토큰 브로커’ 시장을 추적했다. 추론 자원이 일종의 준화폐처럼 유통되면서 비용 절감과 함께 보안·컴플라이언스 리스크도 커지고 있다.

더 보기
CCTest · Blog
LiveAnimate: 실시간 장편 인물 애니메이션을 가능하게 하다
추론·배포
cctest.ai
추론·배포

LiveAnimate: 실시간 장편 인물 애니메이션을 가능하게 하다

LiveAnimate는 포즈 기반 인물 애니메이션의 오래된 딜레마, 즉 좋은 품질과 느린 속도 사이의 충돌을 다룬다. 14B 규모의 비디오 DiT를 실시간 스트리밍 추론에 맞게 재구성해 긴 시퀀스에서도 안정성을 유지하려는 점이 핵심이다.

더 보기
CCTest · Blog
GPTQ-2D: 양측 적응형 반올림을 4차 시간에서 3차 시간으로
추론·배포
cctest.ai
추론·배포

GPTQ-2D: 양측 적응형 반올림을 4차 시간에서 3차 시간으로

GPTQ-2D는 잔차의 왼쪽과 오른쪽 모두에 기저 행렬이 작용하는 더 일반적인 적응형 반올림 문제를 다룬다. 단순 벡터화 방식과 동일한 반올림 결과를 유지하면서, 반대각선 단위 처리로 계산 복잡도를 3차 시간으로 낮춘다.

더 보기
CCTest · Blog
투기적 디코딩의 손실 검증 재검토: 더 빠른 추론이 바꾸는 생성 분포
추론·배포
cctest.ai
추론·배포

투기적 디코딩의 손실 검증 재검토: 더 빠른 추론이 바꾸는 생성 분포

이 논문은 투기적 디코딩에서 손실 검증이 효율을 높이는 동시에 모델의 디코딩 분포를 바꿀 수 있음을 분석한다. 검증을 느슨하게 하는 방식은 속도 향상뿐 아니라 품질 저하 위험도 함께 가져온다.

더 보기