Arm CPU 위의 vLLM 최적화: 실행 가능성에서 실전 추론으로
vLLM은 PyTorch, oneDNN, KleidiAI 커뮤니티와 함께 Arm Neoverse 서버용 LLM 서빙 경로를 개선했다. 패키징, 메모리 할당, 동기화, BF16 dense layer, paged attention까지 전반적인 병목을 다뤘다.
더 보기vLLM은 PyTorch, oneDNN, KleidiAI 커뮤니티와 함께 Arm Neoverse 서버용 LLM 서빙 경로를 개선했다. 패키징, 메모리 할당, 동기화, BF16 dense layer, paged attention까지 전반적인 병목을 다뤘다.
더 보기Ai2가 Hugging Face Blog에서 공개한 OlmoEarth Platform은 지리공간 파운데이션 모델을 실제 대규모 위성 추론 작업에 투입하기 위한 인프라다.
더 보기vLLM과 Speculators가 P-EAGLE, DFlash, DSpark를 지원하며 추측 디코딩의 초점을 순차적 후보 토큰 생성에서 병렬 후보 블록 생성으로 옮겼다. 이는 LLM 서빙에서 드래프트 단계의 지연과 운영 튜닝 부담을 줄이려는 시도다.
더 보기vLLM이 Kimi K3 가중치 공개와 동시에 하이브리드 KDA 프리픽스 캐싱, DSpark 추측 디코딩, 분리형 배포, NVIDIA 및 AMD GPU 최적화를 포함한 서빙 지원을 발표했다. 핵심은 모델 실행 자체보다 2.8조 파라미터급 하이브리드 MoE를 실제 서비스 경로로 만드는 데 있다.
더 보기Runway가 품질, 속도, 비용 기준으로 이미지·영상·오디오 생성 모델을 자동 선택하는 Media Router를 공개했다. 생성형 미디어 시장이 단일 모델 경쟁을 넘어 인프라와 라우팅 경쟁으로 이동하고 있음을 보여준다.
더 보기IBM Research는 Agent 시스템의 모델 라우팅을 단순 분류 문제로 보면 한계가 있다고 지적한다. 실제 운영에서는 비용, 품질, 지연시간, 캐시, 인프라, 거버넌스가 함께 작동한다.
더 보기이 arXiv 논문은 모델 압축과 추론 가속을 알고리즘 선택 문제가 아니라 배포 제약을 풀어가는 엔지니어링 문제로 재정의한다. 데이터, 지연 시간, 메모리, 정확도 허용치, 재학습 예산이 핵심 축이다.
더 보기vLLM이 Thinking Machines Lab의 1T 파라미터 멀티모달 모델 TML Inkling을 출시 당일 지원한다고 밝혔다. MTP, 장문 컨텍스트, MoE, 병렬화, 캐시 관리까지 포함한 고성능 추론 통합이다.
더 보기