VideoGen-Agent, 영상 생성에 도구 사용과 자기 검증을 더하다
들어가며
최근 영상 생성 모델은 높은 화질과 더 자연스러운 시간적 일관성을 보여주고 있다. 그러나 전문적인 절차, 특정 인물이나 사물의 정체성, 물리 법칙, 복잡한 장면 구성, 순서가 있는 사건을 한 번에 요구하면 문제가 드러난다. 영상의 외형은 그럴듯해도 등장인물이 바뀌거나, 물리적 관계가 어긋나거나, 여러 장면 사이의 연속성이 끊길 수 있다.
프린스턴대학교 연구팀이 제안한 VideoGen-Agent는 영상 생성을 에이전트의 반복적인 작업으로 다룬다. 하나의 생성 모델이 최종 결과를 바로 출력하게 하는 대신, 에이전트가 프롬프트와 중간 결과를 확인하고 외부 도구를 호출하며 다음 행동을 결정한다.
핵심 구조
- 도구 조율: 에이전트는 증강, 생성, 검증 도구를 여러 차례 상호작용하며 사용한다. 입력 조건을 보완하고 영상을 만든 뒤, 결과가 요구사항에 맞는지 확인하는 흐름이다.
- 두 단계 학습: 먼저 교사가 만든 궤적으로 지도 미세조정을 수행해 기본적인 도구 사용법을 익힌다. 이후 다중 작업 에이전트 강화학습으로 도구 선택과 처리 순서를 개선한다.
- 여섯 가지 작업을 하나의 정책으로 처리: 절차적 지식, 단일·다중 개체 정체성 보존, 물리적 일관성, 장면 구성, 다중 샷 시간 구조를 포함한 범주 균형 데이터를 사용한다.
- 복합 보상 설계: 보상은 영상 품질만 평가하지 않는다. 도구 호출이 유효한지, 현재 작업에 적합한 도구를 선택했는지, 최종 영상이 얼마나 좋은지를 함께 반영한다.
결과와 한계
연구진은 복잡한 영상 생성 조건을 평가하기 위해 600개 프롬프트로 구성된 별도 테스트 세트 VABench를 제시했다. 논문에 따르면 VideoGen-Agent의 점수는 75.6으로, 기본 텍스트-투-비디오 생성기의 56.5보다 19.1포인트 높았다. 생성 도구를 더 강한 버전으로 교체하면 에이전트를 추가로 학습하지 않아도 86.1점까지 올라갔다. 사람을 대상으로 한 비교에서는 업그레이드된 구성이 가장 강한 단독 기준 모델보다 84.3%의 비교에서 선호됐다.
이 결과는 에이전트가 특정 생성기에만 묶이지 않고, 하위 도구가 개선될 때 그 혜택을 함께 얻을 수 있음을 시사한다. 다만 제공된 자료는 전체 점수를 중심으로 설명하며, 작업 범주별 세부 결과나 도구 호출 비용, 추론 지연 시간, 실패 사례의 분포는 제시하지 않는다. 실제 서비스에서는 반복적인 생성과 검증이 품질뿐 아니라 비용과 안정성에 미치는 영향도 확인해야 한다.
의미와 영향
VideoGen-Agent의 의미는 단순히 새로운 영상 생성기를 추가했다는 데 있지 않다. 프롬프트 해석, 도구 선택, 생성, 결과 확인, 재시도를 하나의 의사결정 루프로 묶어 여러 제약이 얽힌 영상 작업을 실제 제작 과정에 가깝게 구성했다는 점이 핵심이다.
앞으로 영상 생성 시스템을 비교할 때는 한 번의 샘플 품질뿐 아니라, 추가 정보가 필요한 시점과 다시 생성해야 할 시점을 판단하는 능력도 중요해질 수 있다. 특히 여러 샷에 걸친 인물·사물의 동일성을 어떻게 검증하는지가 실용성을 좌우할 가능성이 크다. 저자들은 프로젝트 페이지와 코드, VABench를 공개했다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…