아티클 목록으로
비전·비디오

VideoCoCo: Blender 코드를 비디오 생성의 과정 추론으로 활용하다

약 3분 소요

도입

텍스트로부터 영상을 생성하는 모델은 시각적 품질 면에서 빠르게 발전하고 있다. 하지만 움직임이 실제 물리 법칙처럼 자연스럽게 이어지는지는 여전히 어려운 문제다. 짧은 프롬프트는 어떤 장면을 만들고 싶은지는 설명할 수 있지만, 물체가 어떻게 움직이고 충돌하며 시간에 따라 어떻게 변해야 하는지까지 충분히 담기 어렵다.

VideoCoCo는 이 한계를 줄이기 위해 실행 가능한 코드를 중간 추론으로 사용한다. 논문은 이를 Code-as-CoT라고 부른다. 일반적인 Chain-of-Thought가 텍스트 설명이나 간단한 계획에 머무르는 경우가 많다면, VideoCoCo는 에이전트가 Blender 프로그램을 작성하게 한다. 이 프로그램은 장면 구성과 시간적 변화를 명시적으로 정의하며, 실제로 실행될 수 있다.

핵심 내용

  • 이중 엔진 구조: 하나의 엔진은 Blender 코드를 실행해 시공간 초안을 만들고, 다른 생성형 비디오 엔진은 그 초안을 조건으로 삼아 사실적인 영상을 만든다.
  • 실행 가능한 중간 표현: 코드 기반 표현은 단순한 설명이 아니라 실행, 점검, 수정이 가능하다. 따라서 영상의 동적 과정을 더 명확하게 통제할 수 있다.
  • 결정적인 시공간 초안: 시뮬레이션으로 생성된 초안은 시간 축에 따른 장면 변화를 구조적으로 담고 있어, 비디오 모델이 모든 물리 과정을 암묵적으로 추론해야 하는 부담을 줄인다.
  • VideoCoCo-3K 데이터셋: 저자들은 초안, 지시문, 목표 영상으로 구성된 3천 규모의 큐레이션 데이터셋을 구축해 비디오 편집기가 시뮬레이션 초안에 적응하도록 했다.
  • 벤치마크 성능 향상: 논문에 따르면 VideoCoCo는 OmniWeaving 기준선을 PhyGenBench에서 0.475에서 0.558로, VBench-2.0에서 52.18에서 77.88로 끌어올렸고, 두 벤치마크 평균 점수에서 최고 성과를 달성했다.

의미와 영향

VideoCoCo의 중요한 점은 비디오 생성을 두 단계로 나눈다는 데 있다. 먼저 프로그램과 시뮬레이션으로 동적 과정을 구성하고, 이후 생성 모델이 시각적 품질을 높인다. 이 방식은 하나의 모델이 텍스트만 보고 물리와 픽셀을 모두 추론하는 방식보다 더 제어 가능하고, 더 점검하기 쉽다.

물론 과제도 남아 있다. Blender 초안이 현실 세계의 복잡한 물리 현상을 모두 포괄할 수 있는 것은 아니며, 에이전트가 항상 올바른 코드를 작성한다는 보장도 없다. 또한 최종 비디오 편집 과정에서 초안의 움직임이 얼마나 충실히 유지되는지도 중요하다. 그럼에도 VideoCoCo는 향후 비디오 생성이 단순한 픽셀 샘플링을 넘어, 실행 가능한 세계 구성과 생성 모델의 결합으로 발전할 수 있음을 보여준다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Vidu S2, 실시간 아바타·영상 편집·공간 영상 생성으로 확장
비전·비디오
cctest.ai
비전·비디오

Vidu S2, 실시간 아바타·영상 편집·공간 영상 생성으로 확장

Vidu S2는 대화형 디지털 아바타와 실시간 영상 스트림 편집 모델을 함께 제공한다. 생성 중에도 지시와 참고 이미지를 바꿀 수 있어, 영상을 한 번 생성하고 끝내는 방식에서 지속적으로 조작하는 방식으로 나아가려는 시도다.

더 보기
CCTest · Blog
ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해
비전·비디오
cctest.ai
비전·비디오

ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해

ShallowStream은 MLLM의 얕은 층을 활용해 스트리밍 영상의 프레임 인코딩과 검색 색인 구축을 수행하고, 질의가 들어올 때만 깊은 층을 사용합니다. 논문은 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 줄였다고 보고합니다.

더 보기
CCTest · Blog
DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행
비전·비디오
cctest.ai
비전·비디오

DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행

arXiv 연구가 동영상 생성 모델의 증류와 인간 선호 정렬을 단일 단계에서 결합하는 DM-Align을 제안했다. 샘플 분포 차이로 선호 유도 그래디언트를 구성해 기존 강화학습 파이프라인의 계산량과 불안정성을 줄이는 것이 목표다.

더 보기