아티클 목록으로
비전·비디오

SANA-Video 2.0: 하이브리드 어텐션으로 고해상도 비디오 생성을 가속

약 3분 소요

도입

비디오 생성 모델은 해상도와 프레임 수, 영상 길이가 늘어날수록 attention 계산 비용이 빠르게 증가합니다. 특히 full-softmax 기반 비디오 Diffusion Transformer는 표현력은 강하지만 긴 시퀀스에서는 비용 부담이 큽니다.

SANA-Video 2.0은 이 병목을 줄이기 위해 attention 구조를 하이브리드 방식으로 설계한 모델입니다. 5B와 14B 두 규모가 하나의 통일된 아키텍처로 제시되며, 단일 GPU에서 최대 720p의 고품질 비디오 생성을 목표로 합니다. 핵심은 선형 어텐션의 긴 시퀀스 확장성을 유지하면서, 필요한 지점에 softmax 어텐션을 앵커처럼 배치하는 것입니다.

핵심 내용

  • Hybrid Linear-Softmax Attention: 모든 층에서 이차 복잡도의 softmax attention을 사용하는 대신, 대부분의 혼합은 gated linear attention이 담당합니다. 여기에 3:1 비율로 gated-softmax anchor를 주기적으로 삽입해, 순수 선형 어텐션이 놓치기 쉬운 full-rank 토큰 상호작용을 복원하려 합니다.
  • Block Attention Residuals, AttnRes: softmax anchor가 만든 갱신된 표현을 이후 층에서도 활용하기 위한 장치입니다. 완료된 블록의 요약 정보를 뒤쪽 선형 층으로 전달해 anchor 특징을 재사용합니다. 논문은 이 방식이 깊은 층의 effective rank를 약 12% 높였다고 보고합니다.
  • 처음부터 하이브리드로 학습: SANA-Video 2.0은 기존 softmax 모델을 사후적으로 선형화한 접근이 아닙니다. 하이브리드 attention 구조를 전제로 처음부터 학습해, 모델이 이 구조에 직접 적응하도록 했습니다.
  • 25% softmax의 절충점: 저해상도 proxy 연구를 통해, 품질과 효율 사이의 적절한 균형점으로 25% softmax가 제시됩니다. 이는 선형 attention과 softmax anchor의 3:1 배치로 이어집니다.
  • 보고된 성능: 40단계 샘플링 기준으로, SANA-Video 2.0은 단일 H100에서 480p 비디오 생성 시 VBench 84.30을 기록하고 13.2초가 걸렸다고 합니다. 또한 720p/60s 설정에서 컴파일된 DiT forward는 대응되는 full-softmax 기준 모델보다 3.2배 빠르며, 비디오 길이가 길어질수록 차이가 커진다고 설명합니다.
  • Sol-Engine 최적화: kernel fusion, caching, sparse attention을 포함한 Sol-Engine 최적화를 적용하면 하드웨어 친화적인 백본이 추가로 3.58배 빨라집니다. 논문은 5B 파이프라인이 720p/5s에서 13.06초를 달성했으며, 단일 H100에서 Wan 2.2-A14B보다 120배 빠르다고 보고합니다.

의미와 영향

SANA-Video 2.0의 핵심 의미는 full-softmax와 순수 선형 어텐션 사이의 실용적인 중간 경로를 제시했다는 데 있습니다. softmax를 전면적으로 쓰지 않으면서도, 주기적인 anchor와 residual 경로를 통해 전역 상호작용과 깊은 층의 표현력을 보강합니다.

이 결과가 다양한 조건에서 재현된다면, 장시간·고해상도 비디오 생성 모델 설계에 중요한 참고점이 될 수 있습니다. 또한 비디오 생성 경쟁이 단순한 파라미터 수 확대를 넘어, attention 구조, 학습 전략, 컴파일 및 추론 시스템 최적화의 결합으로 이동하고 있음을 보여줍니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해
비전·비디오
cctest.ai
비전·비디오

ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해

ShallowStream은 MLLM의 얕은 층을 활용해 스트리밍 영상의 프레임 인코딩과 검색 색인 구축을 수행하고, 질의가 들어올 때만 깊은 층을 사용합니다. 논문은 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 줄였다고 보고합니다.

더 보기
CCTest · Blog
DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행
비전·비디오
cctest.ai
비전·비디오

DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행

arXiv 연구가 동영상 생성 모델의 증류와 인간 선호 정렬을 단일 단계에서 결합하는 DM-Align을 제안했다. 샘플 분포 차이로 선호 유도 그래디언트를 구성해 기존 강화학습 파이프라인의 계산량과 불안정성을 줄이는 것이 목표다.

더 보기
CCTest · Blog
장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까
비전·비디오
cctest.ai
비전·비디오

장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까

장시간 동영상 멀티모달 모델에서 프레임 선택, 공간 압축, 절약한 예산의 재투자를 분리해 비교한 연구가 나왔다. 결과적으로 중요한 것은 프레임을 무조건 선명하게 만드는 것이 아니라, 질문과 관련된 시간적 증거를 더 넓게 확보하는 것으로 나타났다.

더 보기