아티클 목록으로
비전·비디오

JoyAI-Video-Edit: 실시간 개방형 비디오 편집을 위한 자기회귀 확산

약 3분 소요

실시간 비디오 편집은 단순히 빠르게 결과를 내는 문제가 아닙니다. 사용자의 지시에 즉시 반응하면서도 원본 영상의 정체성을 유지해야 하고, 긴 구간에서도 화면이 흔들리거나 흐트러지지 않아야 합니다. JoyAI-Video-Edit는 이런 요구를 동시에 만족시키기 위해 제안된 개방형 비디오 편집 프레임워크입니다.

핵심 아이디어

  • 16B 파라미터 자기회귀 확산 구조로 스트리밍 편집을 수행
  • Chunk-wise autoregressive adaptation으로 온라인 추론 환경에 맞게 적응
  • SA-DMD로 원본 영상과의 정합성을 강화
  • Long-Horizon Autoregressive Distillation으로 긴 영상에서 누적되는 드리프트를 완화

이 연구가 중요한 이유는, 미래 프레임을 볼 수 없고 전체 길이도 미리 알 수 없는 조건을 전제로 하기 때문입니다. 많은 오프라인 편집 방식은 전체 시퀀스를 한 번에 다루는 데 강하지만, 실제 실시간 환경에서는 그런 가정이 성립하지 않습니다. JoyAI-Video-Edit는 이러한 간극을 줄이기 위해 분할 처리와 증류를 함께 사용합니다.

무엇이 의미 있는가

이 방법의 강점은 학습과 추론 사이의 차이를 직접 다루는 데 있습니다. 스트리밍 편집에서는 모델이 학습할 때 본 문맥과 실제 사용 시의 순차적 입력이 달라지면서, 색감 변화나 객체 왜곡, 장면 일관성 붕괴가 생기기 쉽습니다. SA-DMD는 원본을 기준점으로 분포를 맞추고, 장기 증류는 시간이 지날수록 커지는 오차를 줄이도록 설계되었습니다.

논문 요약에 따르면 JoyAI-Video-Edit는 기존 스트리밍 편집기보다 더 나은 성능을 보였고, 짧은 영상과 긴 영상 모두에서 강한 오프라인 시스템과 경쟁할 수준을 보였습니다. 또한 전체 시스템은 단일 Nvidia B200 GPU에서 720p 비디오 편집을 약 30 FPS로 수행할 수 있다고 보고합니다. 이는 연구 성과뿐 아니라 실제 적용 가능성 측면에서도 눈에 띄는 결과입니다.

파급 효과

이런 기술이 더 안정적으로 발전하면 라이브 영상 처리, 크리에이터용 편집 툴, 인터랙티브 후편집, 반자동 제작 파이프라인 등 다양한 분야에 영향을 줄 수 있습니다. 특히 “open-ended” 편집은 한 번의 생성이 아니라, 사용자의 의도에 따라 계속 이어지는 편집을 뜻하므로 실제 작업 흐름과 더 가깝습니다.

정리하면, JoyAI-Video-Edit는 실시간 비디오 편집을 연구용 데모 수준에서 한 걸음 더 끌어올리는 시도입니다. 확산 모델, 스트리밍 추론, 장기 일관성 문제를 함께 다룬다는 점에서 주목할 만한 방향입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Vidu S2, 실시간 아바타·영상 편집·공간 영상 생성으로 확장
비전·비디오
cctest.ai
비전·비디오

Vidu S2, 실시간 아바타·영상 편집·공간 영상 생성으로 확장

Vidu S2는 대화형 디지털 아바타와 실시간 영상 스트림 편집 모델을 함께 제공한다. 생성 중에도 지시와 참고 이미지를 바꿀 수 있어, 영상을 한 번 생성하고 끝내는 방식에서 지속적으로 조작하는 방식으로 나아가려는 시도다.

더 보기
CCTest · Blog
ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해
비전·비디오
cctest.ai
비전·비디오

ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해

ShallowStream은 MLLM의 얕은 층을 활용해 스트리밍 영상의 프레임 인코딩과 검색 색인 구축을 수행하고, 질의가 들어올 때만 깊은 층을 사용합니다. 논문은 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 줄였다고 보고합니다.

더 보기
CCTest · Blog
DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행
비전·비디오
cctest.ai
비전·비디오

DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행

arXiv 연구가 동영상 생성 모델의 증류와 인간 선호 정렬을 단일 단계에서 결합하는 DM-Align을 제안했다. 샘플 분포 차이로 선호 유도 그래디언트를 구성해 기존 강화학습 파이프라인의 계산량과 불안정성을 줄이는 것이 목표다.

더 보기