아티클 목록으로
비전·비디오

SparsePR, 분할과 잔차 재구성으로 영상 생성 어텐션 가속

약 3분 소요

영상 생성 모델과 월드 모델은 긴 시공간 시퀀스를 처리하므로 어텐션이 추론 비용의 주요 병목이 되기 쉽습니다. 블록 희소 어텐션은 쿼리와 키 사이의 상호작용 수를 줄일 수 있지만, 어떤 블록을 남길지는 단순한 중요도 순위만으로 결정하기 어렵습니다. 같은 라우팅 경로를 공유하는 쿼리라도 실제로 집중하는 위치가 다를 수 있으며, 유지된 어텐션 질량만으로는 softmax 이후 생략된 상호작용이 출력에 만드는 오차를 예측하기 어렵습니다.

SparsePR은 이 문제를 분할과 잔차 보정이라는 두 단계로 해결합니다.

  • 응답 결합 파티셔닝: 일부 쿼리 행을 샘플링해 키에 대한 응답을 측정하고, 키와 값을 쌍으로 묶은 K/V 그룹을 구성합니다. 이 응답의 중심점을 이용해 쿼리 응답 좌표를 만들기 때문에, 단순한 위치나 행별 점수가 아니라 실제 반응 패턴이 비슷한 쿼리를 같은 경로로 보낼 수 있습니다.
  • 프로브 기반 잔차 재구성: 소수의 쿼리 행에는 정확한 어텐션을 실행합니다. 정확한 출력과 희소 출력의 차이를 프로브 잔차로 삼고, 이를 바탕으로 현재 호출에 특화된 affine 보정을 학습합니다. 보정은 프로브에서 관측된 출력 부분공간 안에서만 적용됩니다.
  • 실행 가능한 희소성: SparsePR은 보존된 어텐션 질량만 평가하지 않고 희소 출력의 재구성 오차를 직접 다룹니다. 또한 블록 희소 GPU 구현을 통해 알고리즘상의 희소성을 실제 처리 속도로 연결하려고 합니다.

논문은 HunyuanVideo, Wan2.2, Cosmos2.5, Cosmos3-Nano 등 서로 다른 네 가지 영상 생성·월드 모델에서 SparsePR을 평가했습니다. 실제 실행된 쿼리-키 페어 밀도 22.026.0%에서도 생성 품질을 유지했으며, 종단 간 1.482.61배의 가속을 달성했다고 보고합니다. 소거 실험에서는 프로브 피팅이 재구성 오차 감소의 대부분을 담당했습니다. 응답 결합 파티셔닝은 상호작용을 그대로 버리는 방식의 오차를 낮추고, 사용할 수 있는 프로브 수가 제한된 상황에서 재구성 성능을 개선했습니다.

이 연구의 핵심 의미는 재학습 없는 희소 어텐션의 목표를 중요한 블록을 고르는 데서 생략된 블록의 출력 기여까지 추정하는 방향으로 확장했다는 점입니다. 모델 파라미터를 변경하지 않고 소량의 정확한 계산만으로 현재 어텐션 호출의 잔차 구조를 보정하므로, 긴 시공간 컨텍스트를 처리하는 영상 생성과 월드 모델의 추론 최적화에 적용할 여지가 있습니다. 다만 실제 효과는 프로브 예산, 분할 품질, GPU 커널 효율에 좌우될 수 있습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
InfinityEdit, 고정 영상 편집을 무한 스트리밍 편집으로 확장
비전·비디오
cctest.ai
비전·비디오

InfinityEdit, 고정 영상 편집을 무한 스트리밍 편집으로 확장

InfinityEdit는 완성된 영상 클립을 프레임 단위로 다시 쓰는 대신, 편집 지시를 반영하면서 앞으로 이어질 영상 구간을 생성하는 방식을 제안합니다. 영상 이력, 시간적 인과성, 편집 텍스트를 연결하는 경량 어댑터로 스트리밍 영상 생성기에 편집 기능을 더합니다.

더 보기
CCTest · Blog
4DAnyone: 일반 단안 영상에서 동적 4D 인물 재구성
비전·비디오
cctest.ai
비전·비디오

4DAnyone: 일반 단안 영상에서 동적 4D 인물 재구성

4DAnyone은 보정되지 않은 단안 인물 영상에서 시점 간 일관성이 높은 다중 시점 영상을 생성한 뒤 이를 4D Gaussian Splatting으로 변환합니다. 늘어나는 참조 정보와 분할된 시점 그룹 사이의 구조적 불일치를 두 가지 컨텍스트 설계로 해결하려 합니다.

더 보기