아티클 목록으로
비전·비디오

장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까

약 4분 소요

장시간 동영상 이해의 핵심 병목은 모델이 프레임을 해석하지 못한다는 데만 있지 않다. 필요한 장면을 애초에 입력으로 보지 못하는 문제가 더 근본적일 수 있다. 동영상을 1초마다 한 프레임씩 샘플링하면 한 시간 분량은 3600장의 이미지가 된다. 그러나 컨텍스트 길이와 시각 토큰 예산, 추론 비용에는 한계가 있으므로 실제 시스템은 이 중 일부만 선택해야 한다. 따라서 제한된 예산을 소수의 고해상도 프레임에 쓸지, 낮은 해상도로 더 많은 시점을 볼지가 중요한 설계 문제가 된다.

이번 연구는 여러 요소를 한꺼번에 바꾼 기존 비교의 한계를 피하려 했다. 연구진은 프레임 점수화기, 프롬프트 경계, 해상도 정책, 응답 모델을 고정하고, 프레임 선택과 공간 압축, 압축으로 생긴 여유 예산의 재투자를 각각 따로 변경했다. 6가지 학습 불필요 선택 규칙을 3개 장시간 동영상 벤치마크와 2개 응답 모델에서 평가해, 어떤 결정이 실제 성능을 좌우하는지 살폈다.

핵심 결과

  • 가장 큰 영향은 프레임 선택에서 나온다. LongVideoBench의 한 시간급 구간에서 질의 기반으로 선택한 8개 프레임은 균일하게 배치한 16개 프레임보다 6.9%포인트 높은 성능을 보였다. 단순히 프레임 수를 늘리는 것보다 질문에 필요한 정보를 담은 시점을 고르는 것이 중요하다는 뜻이다.
  • 오래된 알고리즘도 충분히 경쟁력 있다. 수십 년 전 개발된 희소 근사 알고리즘인 직교 매칭 추적(OMP)을 수정 없이 사용했는데도, 세 벤치마크에서 비교한 전용 선택기들과 같거나 1%포인트 이내의 차이를 보였다. 장시간 동영상 선택기를 반드시 복잡하게 설계하거나 별도로 학습해야 하는 것은 아니다.
  • 공간 압축 자체의 손실은 작다. 타임스탬프를 그대로 유지한 상태에서 프레임마다 할당한 공간 토큰을 절반으로 줄여도 보고된 정확도 하락은 최대 0.44%포인트였다. 컨텍스트가 제한된 시스템에서는 모든 프레임을 최고 해상도로 처리할 필요가 없을 수 있다.
  • 효과는 절약분을 다시 쓸 때 커진다. 압축 후 예산을 남겨두는 것만으로는 큰 이점이 없지만, 절약한 토큰으로 프레임 수를 2배로 늘리면 총 시각 예산을 비슷하게 유지하면서 추가로 약 2~3%포인트의 성능 향상을 얻었다. 핵심은 압축이 아니라 압축을 통해 시간적 범위를 넓히는 데 있다.

의미와 한계

이 결과는 장시간 동영상 추론을 프레임 한 장의 품질을 극대화하는 문제가 아니라, 제한된 시각 토큰으로 얼마나 많은 관련 증거를 포착할지 결정하는 예산 배분 문제로 보게 한다. 실무적으로는 먼저 질문과 관련된 시점을 고르고, 각 프레임의 공간 세부 정보를 적절히 줄인 뒤, 남은 예산을 새로운 시점을 추가하는 데 사용하는 순서가 합리적이다.

연구는 선택기 비교를 해석할 때 구현과 평가 조건을 함께 봐야 한다는 점도 보여준다. 연구진은 자체 AKS 기준선에서 구현 버그를 발견했다고 보고했으며, 두 응답 모델 사이에서도 0.07~3.74%포인트의 차이가 나타났다. 따라서 새로운 선택 알고리즘의 이름이나 복잡성보다, 변수를 통제한 소거 실험과 구현 검증, 여러 모델에서의 재현성이 더 중요할 수 있다.

다만 결론은 사용된 벤치마크, 모델, 예산 설정에 한정해 이해해야 한다. 모든 동영상 작업에 동일한 압축 비율이 최적이라고 단정할 수는 없다. 그럼에도 시각 토큰이 부족한 환경에서는 중복된 공간 세부 정보 일부를 줄이고, 질문에 관련된 시간적 증거를 더 많이 확보하라는 설계 원칙을 제시한다는 점에서 의미가 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개
비전·비디오
cctest.ai
비전·비디오

Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개

Google DeepMind가 Gemini에 Agentic Video Understanding을 도입했습니다. 모델이 영상, 오디오, 자막을 상황에 맞게 검색하고 다시 확인하며, 공식 벤치마크에서 토큰 사용량은 최대 88%, 비용은 최대 66% 줄고 정확도는 최대 7% 향상됐다고 밝혔습니다.

더 보기
CCTest · Blog
Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성
비전·비디오
cctest.ai
비전·비디오

Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성

Luce는 기하 구조와 PBR 재질을 통합한 멀티모달 Gaussian 표현을 제안하고, 단일 이미지에서 재조명 가능한 3D 에셋을 생성합니다. PBR Gaussian과 함께 텍스처 메시 및 탄젠트 공간 노멀 맵도 선택적으로 출력할 수 있습니다.

더 보기
CCTest · Blog
고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개
비전·비디오
cctest.ai
비전·비디오

고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개

고덕이 최근 12개 프레임만을 국소 문맥으로 활용해 긴 영상의 3D 장면을 순차적으로 재구성하는 모델 ABot-Recon을 공개했다. 장기 메모리 의존을 없애 장거리 시퀀스에서 발생하는 오차 누적, 속도 저하, 메모리 증가 문제를 줄이는 것이 핵심이다.

더 보기