아티클 목록으로
비전·비디오

JoyAI-Video-Edit: 실시간 개방형 비디오 편집을 위한 자기회귀 확산

약 3분 소요

실시간 비디오 편집은 단순히 빠르게 결과를 내는 문제가 아닙니다. 사용자의 지시에 즉시 반응하면서도 원본 영상의 정체성을 유지해야 하고, 긴 구간에서도 화면이 흔들리거나 흐트러지지 않아야 합니다. JoyAI-Video-Edit는 이런 요구를 동시에 만족시키기 위해 제안된 개방형 비디오 편집 프레임워크입니다.

핵심 아이디어

  • 16B 파라미터 자기회귀 확산 구조로 스트리밍 편집을 수행
  • Chunk-wise autoregressive adaptation으로 온라인 추론 환경에 맞게 적응
  • SA-DMD로 원본 영상과의 정합성을 강화
  • Long-Horizon Autoregressive Distillation으로 긴 영상에서 누적되는 드리프트를 완화

이 연구가 중요한 이유는, 미래 프레임을 볼 수 없고 전체 길이도 미리 알 수 없는 조건을 전제로 하기 때문입니다. 많은 오프라인 편집 방식은 전체 시퀀스를 한 번에 다루는 데 강하지만, 실제 실시간 환경에서는 그런 가정이 성립하지 않습니다. JoyAI-Video-Edit는 이러한 간극을 줄이기 위해 분할 처리와 증류를 함께 사용합니다.

무엇이 의미 있는가

이 방법의 강점은 학습과 추론 사이의 차이를 직접 다루는 데 있습니다. 스트리밍 편집에서는 모델이 학습할 때 본 문맥과 실제 사용 시의 순차적 입력이 달라지면서, 색감 변화나 객체 왜곡, 장면 일관성 붕괴가 생기기 쉽습니다. SA-DMD는 원본을 기준점으로 분포를 맞추고, 장기 증류는 시간이 지날수록 커지는 오차를 줄이도록 설계되었습니다.

논문 요약에 따르면 JoyAI-Video-Edit는 기존 스트리밍 편집기보다 더 나은 성능을 보였고, 짧은 영상과 긴 영상 모두에서 강한 오프라인 시스템과 경쟁할 수준을 보였습니다. 또한 전체 시스템은 단일 Nvidia B200 GPU에서 720p 비디오 편집을 약 30 FPS로 수행할 수 있다고 보고합니다. 이는 연구 성과뿐 아니라 실제 적용 가능성 측면에서도 눈에 띄는 결과입니다.

파급 효과

이런 기술이 더 안정적으로 발전하면 라이브 영상 처리, 크리에이터용 편집 툴, 인터랙티브 후편집, 반자동 제작 파이프라인 등 다양한 분야에 영향을 줄 수 있습니다. 특히 “open-ended” 편집은 한 번의 생성이 아니라, 사용자의 의도에 따라 계속 이어지는 편집을 뜻하므로 실제 작업 흐름과 더 가깝습니다.

정리하면, JoyAI-Video-Edit는 실시간 비디오 편집을 연구용 데모 수준에서 한 걸음 더 끌어올리는 시도입니다. 확산 모델, 스트리밍 추론, 장기 일관성 문제를 함께 다룬다는 점에서 주목할 만한 방향입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
InfiniSplat: 단일 이미지 3DGS를 표면 정렬 표현으로 확장하다
비전·비디오
cctest.ai
비전·비디오

InfiniSplat: 단일 이미지 3DGS를 표면 정렬 표현으로 확장하다

InfiniSplat은 한 장의 이미지에서 큰 시점 변화에도 더 일관된 3D Gaussian Splatting 표현을 생성하려는 프레임워크입니다. 픽셀 격자 중심 예측 대신 기하 기반 샘플링과 암시적 가우시안 디코딩을 사용합니다.

더 보기