아티클 목록으로
비전·비디오

FlashForward, 인플라이트 KV 캐시로 장편 영상 확산 생성 가속

약 3분 소요

긴 영상을 확산 모델로 생성할 때 가장 어려운 문제는 한 장면의 품질만이 아니다. 시간이 길어질수록 사람과 사물의 외관, 움직임, 구조를 유지하면서 다음 구간을 생성해야 한다. 소수 단계 자기회귀 영상 확산은 긴 영상을 시간 청크로 나누고, 각 청크에 짧은 디노이징 단계를 적용한다. 이후 청크가 앞선 내용을 기억하려면 어텐션 내부의 키-값(KV) 캐시가 필요하다.

이미 존재하는 계산을 재사용하다

기존 방법은 이전 청크의 깨끗하거나 노이즈가 적은 KV 이력을 만들기 위해 추가적인 모델 순전파를 수행할 수 있다. 이 계산은 출력 잠재를 진행시키지 않고 캐시만 갱신하지만, 그만큼 추론 비용이 늘어난다.

FlashForward는 일반적인 디노이징 순전파가 현재 청크의 KV를 이미 계산한다는 점에 주목한다. 이 인플라이트 캐시를 버리고 다시 만드는 대신, 현재 청크가 특정 디노이징 단계를 마치는 즉시 다음 청크에 전달한다. 이에 따라 단계별로 GPU를 배정하고, 서로 다른 청크가 서로 다른 디노이징 단계에서 동시에 실행되는 파이프라인을 만들 수 있다. 캐시 갱신만을 위한 추가 순전파를 줄이는 것이 핵심이다.

빠른 캐시 사용의 품질 비용

그러나 일찍 사용할 수 있는 캐시는 완전히 정제된 과거 이력이 아니다. 단계에 대응하는 이력만 활용하면 청크가 이어질수록 노이즈가 누적될 수 있고, 외관 변화나 움직임의 드리프트가 발생할 수 있다. FlashForward는 이를 보완하기 위해 희소한 클린 앵커 잠재를 추가한다. 해당 영역이 실제로 생성되기 전에 보조 앵커를 만들고, 이를 클린 앵커 KV로 사용한다.

두 메모리는 서로 다른 시간 범위를 담당한다.

  • 밀집한 단계 대응 이력: 최근의 세부 변화와 움직임의 연속성을 보존하지만 노이즈가 더 많다.
  • 희소한 클린 앵커: 더 긴 시간 범위에서 구조와 외관의 기준을 제공한다.
  • 결합된 조건 정보: 장거리 안정성과 국소적인 시간 연속성을 함께 유지한다.

논문은 1.3B와 14B 백본, 480p와 720p 해상도, 20초 이상 길이의 16 FPS 영상을 대상으로 평가했다. 최대 4개의 GPU를 사용할 때 HiAR 대비 1.161.69배, Self-Forcing 대비 1.422.92배 빠른 속도를 보고했다. 1.3B 모델의 480p 설정에서는 VBench 점수도 더 높았으며, 20초, 35초, 65초 영상에서 안정적인 결과를 보였다고 설명한다.

의미와 남은 과제

FlashForward의 핵심 기여는 KV 캐시를 완전히 깨끗해진 뒤에만 사용할 필요가 없다고 본 데 있다. 생성 중간의 단계별 상태도 다음 계산과 파이프라인 스케줄링에 활용할 수 있다. 밀집한 이력은 최근 움직임을 담당하고, 희소한 클린 앵커는 장거리 구조를 보정한다. 이렇게 메모리의 역할을 나누면 생성 속도와 시간적 일관성 사이의 균형을 조정할 수 있다.

다만 논문에서 보고한 이점은 소수 단계 자기회귀 확산 설정, 특정 백본, 다중 GPU 구성에 기반한다. 앵커의 밀도, 디노이징 단계 분할, GPU 간 메모리 통신 비용에 따라 다른 환경에서 실제 효과가 달라질 수 있다. 따라서 FlashForward는 모든 영상 생성 모델에 적용되는 보편적 해법이라기보다, 긴 영상 추론을 위한 KV 캐시 관리 및 파이프라인 설계로 이해하는 편이 정확하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
비디오 확산 모델은 왜 물리 법칙을 어길까? 어텐션의 문제
비전·비디오
cctest.ai
비전·비디오

비디오 확산 모델은 왜 물리 법칙을 어길까? 어텐션의 문제

새로운 해석 가능성 연구는 초기 디노이징 단계에서 RoPE가 공간 어텐션을 과도하게 약화해 비현실적인 움직임을 고정할 수 있다고 분석했다. 연구진은 디노이징 단계별로 RoPE 주파수를 조정하는 경량 방법을 제안했다.

더 보기
CCTest · Blog
Vidu S2, 실시간 아바타·영상 편집·공간 영상 생성으로 확장
비전·비디오
cctest.ai
비전·비디오

Vidu S2, 실시간 아바타·영상 편집·공간 영상 생성으로 확장

Vidu S2는 대화형 디지털 아바타와 실시간 영상 스트림 편집 모델을 함께 제공한다. 생성 중에도 지시와 참고 이미지를 바꿀 수 있어, 영상을 한 번 생성하고 끝내는 방식에서 지속적으로 조작하는 방식으로 나아가려는 시도다.

더 보기
CCTest · Blog
ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해
비전·비디오
cctest.ai
비전·비디오

ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해

ShallowStream은 MLLM의 얕은 층을 활용해 스트리밍 영상의 프레임 인코딩과 검색 색인 구축을 수행하고, 질의가 들어올 때만 깊은 층을 사용합니다. 논문은 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 줄였다고 보고합니다.

더 보기