아티클 목록으로
추론·배포

MiniMax H3의 실시간 서비스에는 DiT 고속화만으로 부족하다

약 3분 소요

들어가며

멀티모달 영상 모델의 서비스 성능은 하나의 신경망 블록을 빠르게 만드는 것만으로 결정되지 않는다. MiniMax H3는 영상과 동기화된 오디오를 함께 생성한다. 따라서 요청은 대형 시각언어 인코더, 긴 오디오·비디오 DiT, 영상 및 오디오 VAE, GPU에서 호스트로의 데이터 전송, 프로세스 간 통신, H.264/AAC 기반 MP4 패키징을 차례로 거친다. vLLM-Omni는 DiT만 최적화하는 대신 상주 파이프라인 전체를 출발점으로 삼았다.

핵심 내용

  • 어텐션과 통신을 함께 최적화했다. 패킹된 오디오·비디오 시퀀스에 유효 시퀀스 길이를 전달하고 구조적 후단 패딩을 줄였다. 각 rank는 필요한 임베딩과 RoPE 행만 구성하며, Fast Ulysses는 NCCL SymmetricMemory를 활용해 All-to-All 전후의 레이아웃 재배치를 줄인다.
  • 반복되는 소형 연산을 융합했다. Q/K RMSNorm과 RoPE, 변조·정규화·잔차 처리, SwiGLU 등을 결합해 49번 반복되는 확산 순전파에서 커널 실행 오버헤드를 낮췄다.
  • 디코딩과 미디어 출력을 함께 다뤘다. 영상 VAE 디코딩은 8개 GPU에 분산하고, 오디오와 영상은 독립적으로 처리한다. 디코딩된 프레임은 GPU에서 압축된 uint8 형식으로 바꾼 뒤 페이지 고정 메모리와 IPC를 통해 전달한다. H.264에는 평면 데이터 경로를 사용해 대형 인터리브 RGB 버퍼를 다시 만들지 않는다.
  • FastH3는 확산 계산량을 직접 줄인다. FastVideo의 FastH3는 DiT 순전파를 49회에서 4회로 낮춘다. 8개의 NVIDIA B300, 1344×768, 24 FPS 조건의 별도 실험에서는 10.125초짜리 완전한 MP4를 8.678~8.710초에 생성했다.

벤치마크를 해석하는 법

기준 시스템 레인은 50개의 sigma 지점과 49번의 DiT 순전파를 사용한다. 동일한 프롬프트와 시드를 사용한 비교에서 vLLM-Omni의 요청 제출부터 완성된 MP4 수신까지의 클라이언트 E2E 시간은 56.917초였다. 이 중 DiT가 51.800초, 영상·오디오 VAE가 0.952초, MP4 생성이 1.528초를 차지했다. Diffusers 참조 구현은 82.239초였다. 30.8% 단축이라는 수치는 이 기준 시스템 비교에 해당하며 FastH3의 직접적인 가속 배율은 아니다.

FastH3 측정은 다른 소스 개정판, 프롬프트, 시드와 산출물을 사용하는 별도 실험이다. 따라서 자료는 절대 지연 시간만 제시하고 기준 결과와 나눈 배속을 주장하지 않는다. 또한 여기서 말하는 실시간은 완성된 응답이 재생 시간보다 먼저 준비된다는 뜻이다. 첫 프레임 지연이나 점진적 스트리밍 전송을 의미하지 않는다.

의미와 영향

확산 단계가 짧아지면 VAE, 메모리 이동, 미디어 인코딩이 새로운 병목으로 드러날 수 있다. 이 사례는 실제 서비스의 핵심 지표가 DiT 실행 시간이나 첫 프레임 시간이 아니라 완전한 미디어를 사용할 수 있게 되는 시점이어야 함을 보여준다. 알고리즘 차원의 단계 축소와 통신·메모리·출력 경로에 대한 시스템 설계를 함께 적용해야 사용자가 체감하는 낮은 지연을 얻을 수 있다.

출처: vLLM Blog

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
검증을 학습하는 초안 모델: VAT로 추측 디코딩 효율 향상
추론·배포
cctest.ai
추론·배포

검증을 학습하는 초안 모델: VAT로 추측 디코딩 효율 향상

NAVER AI Lab은 추측 디코딩의 순차 검증 과정을 초안 모델 학습에 반영하는 Verification-Aware Training(VAT)을 제안했다. 모델 구조와 추론 절차를 바꾸지 않고 수용되는 토큰 길이와 실제 추론 속도를 높이는 접근이다.

더 보기
CCTest · Blog
슬라이딩 윈도우 어텐션이 선형 어텐션보다 실용적인 이유
추론·배포
cctest.ai
추론·배포

슬라이딩 윈도우 어텐션이 선형 어텐션보다 실용적인 이유

한 연구에서 어텐션 싱크를 적용한 슬라이딩 윈도우 어텐션이 추가적인 사후 학습 없이 여러 모델과 작업에서 사후 학습된 선형 어텐션과 비슷하거나 더 나은 성능을 보였습니다. 장문맥 추론에서는 격차가 특히 크게 나타났습니다.

더 보기