같은 모델인데 로컬 버전이 둔해지는 이유, 추론 스택의 수치 차이
장문맥 실험에 따르면 모델 가중치와 GPU가 같아도 어텐션 백엔드, KV 캐시 정밀도, 양자화, 다중 GPU 통신이 다음 토큰을 바꿀 수 있다.
더 보기장문맥 실험에 따르면 모델 가중치와 GPU가 같아도 어텐션 백엔드, KV 캐시 정밀도, 양자화, 다중 GPU 통신이 다음 토큰을 바꿀 수 있다.
더 보기TileMix는 융합된 밀집 어텐션 커널 안에서 스코어 타일 그룹을 FP16 또는 INT8 경로로 나눕니다. 토큰 연결을 제거하지 않으면서 긴 컨텍스트 프리필의 품질과 처리량 사이의 균형을 겨냥합니다.
더 보기구조적 압축과 4비트 양자화를 함께 적용하면 추론, 수학, 코딩, 장문맥 성능이 약화될 수 있다. Multiverse Computing은 원본 비압축 모델에서 직접 지식 증류를 수행하는 Quantization-Aware Healing(QAH)을 제안했다.
더 보기Multiverse Computing은 구조적으로 축소되고 4비트 양자화된 모델을 압축 이전의 대형 모델에서 직접 증류하는 QAH를 소개했습니다. GPT-OSS 실험에서 60B MXFP4 모델은 9개 벤치마크 중 7개에서 같은 구조의 BF16 모델을 앞섰습니다.
더 보기ParaTempo는 각 추론 분기가 시간에 따라 답안 공간에서 얼마나 수렴하는지 추적하는 학습 불필요 비동기 병렬 추론 프레임워크입니다. 수렴도가 낮은 경로는 제거하고, 안정된 경로는 일찍 종료하며, 남은 계산을 새로운 분기에 재배분합니다.
더 보기Daedalus-150M은 대형 모델을 축소한 뒤 CPU에 맞추는 대신, 4비트 가중치와 단일 사용자·토큰 단위 생성을 먼저 정하고 구조를 선택한 소형 언어 모델입니다. 18개 블록 중 12개를 짧은 합성곱으로 구성해 긴 문맥에서 KV 캐시를 반복해서 읽는 비용을 줄였습니다.
더 보기Nexus는 MCP 에이전트의 반복적인 전체 도구 스키마 프리필을 검색 기반 라우팅으로 분리한다. KV 캐시 접합도 활용하지만 RoPE 위치 드리프트 때문에 적용 범위에는 명확한 한계가 있다.
더 보기Llama-Mobile은 제한된 메모리와 연산 자원을 가진 모바일 기기에서 비전-언어 모델을 실행하기 위한 양자화 프레임워크를 제안합니다. 모델이 직접 생성한 데이터와 Arm CPU 실행을 고려한 2.7비트 형식을 활용해 Llama 3.2 11B Vision Instruct를 3.7GB로 줄이면서 표준 시각 질의응답 성능을 유지했습니다.
더 보기vLLM이 ROCm 기반 AMD Instinct GPU에서 추측 디코딩을 구성하고 조정하는 방법을 소개했습니다. 네이티브 MTP, EAGLE-3, DFlash, DSpark를 비교하며 실제 성능은 수용률과 작업 부하에 따라 달라진다고 설명합니다.
더 보기같은 모델 가중치라도 GPU, 양자화, 추론 런타임, 어텐션 커널이 다르면 출력이 달라질 수 있습니다. 성능 저하의 원인은 모델 자체가 아니라 추론 스택일 수 있습니다.
더 보기FlashPrefill V2는 평균 보정항, GPU 중심의 희소 어텐션 커널, 페이지드 KV 캐시와 연속 배치 지원을 결합해 장문맥 LLM 프리필을 실서비스 환경에 맞게 개선한다. NVIDIA H20의 128K 문맥에서 FP8 기준 FlashAttention-2 대비 최대 47.26배의 속도 향상을 보고했다.
더 보기기업 지출 관리 플랫폼 Ramp가 여러 대규모 언어 모델을 하나의 API로 이용하고 전환할 수 있는 AI 모델 라우팅 서비스 ‘Router’를 출시했다. 현재 미국에서만 제공되며 2026년 남은 기간에는 라우팅 이용료가 면제된다.
더 보기FreeToken은 서로 다른 개인용 하드웨어에서 대규모 Mixture-of-Experts 모델을 실행하기 위한 엣지 네이티브 서빙 시스템입니다. PC를 작은 GPU로 보는 대신 CPU, GPU, 메모리와 모델 상태를 통합하는 탄력적 추론 플랫폼으로 다룹니다.
더 보기DumpsterCluster 연구는 퇴역 GPU를 묶어 대규모 언어 모델 추론 시스템으로 활용할 수 있음을 보여준다. 그러나 낮은 구매 비용만으로는 충분하지 않으며, 전기요금과 전력의 탄소집약도가 실제 경제성과 지속가능성을 결정한다.
더 보기한 보안 연구 글은 스타트업이 쓰지 못한 AI API 크레딧을 사들여 할인된 추론 접근권으로 되파는 ‘토큰 브로커’ 시장을 추적했다. 추론 자원이 일종의 준화폐처럼 유통되면서 비용 절감과 함께 보안·컴플라이언스 리스크도 커지고 있다.
더 보기LiveAnimate는 포즈 기반 인물 애니메이션의 오래된 딜레마, 즉 좋은 품질과 느린 속도 사이의 충돌을 다룬다. 14B 규모의 비디오 DiT를 실시간 스트리밍 추론에 맞게 재구성해 긴 시퀀스에서도 안정성을 유지하려는 점이 핵심이다.
더 보기UniMoMo는 학습이 끝난 대형 추천 MoE 모델을 더 적은 전문가 수의 표준 MoE로 바꾸는 후처리 압축 프레임워크다. 파라미터 거리 대신 보정 데이터에서의 기능적 유사성과 라우팅 트래픽을 기준으로 전문가를 병합한다.
더 보기vLLM의 Decode Context Parallelism(DCP)은 KV 캐시를 어텐션 헤드가 아니라 시퀀스 차원으로 나눈다. 긴 컨텍스트 에이전트 워크로드에서 GPU 메모리 한계를 낮추고 높은 동시성에서 처리량을 끌어올리기 위한 접근이다.
더 보기GPTQ-2D는 잔차의 왼쪽과 오른쪽 모두에 기저 행렬이 작용하는 더 일반적인 적응형 반올림 문제를 다룬다. 단순 벡터화 방식과 동일한 반올림 결과를 유지하면서, 반대각선 단위 처리로 계산 복잡도를 3차 시간으로 낮춘다.
더 보기OmniScope는 오디오와 비디오의 관련 정보가 같은 순간에 나타난다는 가정을 버린 학습 불필요 토큰 압축 프레임워크다. 질의는 공통 앵커로 쓰되, 각 모달리티의 중요도는 따로 계산한다.
더 보기이 논문은 투기적 디코딩에서 손실 검증이 효율을 높이는 동시에 모델의 디코딩 분포를 바꿀 수 있음을 분석한다. 검증을 느슨하게 하는 방식은 속도 향상뿐 아니라 품질 저하 위험도 함께 가져온다.
더 보기