아티클 목록으로
비전·비디오

Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개

약 3분 소요

장시간 동영상을 분석할 때 개발자는 세부 정보와 비용 사이에서 선택해야 했습니다. 프레임을 촘촘하게 읽으면 짧은 동작이나 미세한 변화를 놓칠 가능성이 줄지만 토큰과 추론 비용이 커집니다. 반대로 샘플링을 듬성듬성 하면 비용은 낮아져도 중요한 순간을 지나칠 수 있습니다. Google DeepMind의 Agentic Video Understanding은 영상 분석의 이 기본 방식을 바꾸려는 기능입니다.

고정 샘플링에서 능동적 관찰로

기존 방식은 보통 일정한 초당 프레임 수로 영상을 모델에 입력합니다. Gemini API의 기본값은 초당 1프레임이며, 개발자가 API를 통해 조정할 수 있습니다. 하지만 이 방식은 사용자의 질문과 관련 없는 구간도 같은 밀도로 처리합니다. 빠르게 일어나는 사건이 샘플링 사이에 발생하면 모델이 이를 충분히 확인하지 못할 수도 있습니다.

에이전틱 처리에서는 Gemini가 작업 목표에 따라 어떤 시간대를 먼저 볼지, 얼마나 높은 프레임 속도로 살필지, 영상·오디오·자막 중 어떤 신호를 사용할지 정합니다. 모델은 내부 동영상 도구를 반복 호출해 후보 구간을 찾은 뒤, 필요하면 해당 구간을 더 높은 밀도로 다시 확인합니다. 과거에는 개발자가 직접 구현해야 했던 영상 분할, 재샘플링, 멀티모달 정보 조정의 일부를 모델이 담당하는 구조입니다.

공식 성능과 주요 활용 사례

Google은 표준 동영상 이해 벤치마크에서 이 기능을 사용하면 토큰 사용량을 최대 88%, 분석 비용을 최대 66% 줄이고 정확도를 최대 7% 높일 수 있다고 설명했습니다. 이는 테스트된 조건에서의 최대 수치이며, 모든 영상과 질문에 동일하게 적용된다는 의미는 아닙니다. 실제 결과는 영상 길이와 구성, 음질, 질문의 구체성, 선택한 모델에 따라 달라질 수 있습니다.

Google이 제시한 주요 활용 사례는 다음과 같습니다.

  • 1초 미만 순간 검색: 짧은 상태 변화나 정확한 컷 경계를 찾아 자동 영상 편집에 활용합니다.
  • 장시간 영상 검색: 강의, 사용법 안내, 수 시간 분량의 녹화물에서 질문과 관련된 정보를 찾습니다.
  • 이상 감지: 의심되는 시간 구간만 높은 프레임 속도로 다시 분석해 미세한 시각적 이상을 확인합니다.
  • 동작 및 객체 카운팅: 빠르게 반복되는 동작이나 개별 객체를 시간 흐름에 따라 추적합니다.

개발자와 서비스에 미칠 영향

이 기능의 의미는 토큰 절감에만 있지 않습니다. 모델이 무엇을 관찰해야 하는지 판단하는 과정을 추론에 포함한다는 점이 핵심입니다. 영상 전체를 한 번에 읽는 대신 필요한 시간 구간에 질의하는 방식에 가까워지므로, 장시간 영상을 처리하는 애플리케이션에서 개발자가 작성해야 할 전처리와 검색 로직이 줄어들 수 있습니다.

Agentic Video Understanding은 Google AI Studio와 Gemini Enterprise Agent Platform의 Gemini API에서 제공됩니다. 지원 모델은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite이며, API 설정에서 처리 방식을 “agentic”으로 지정하면 됩니다. Google은 별도의 기능 이용료 없이 표준 Gemini API 토큰 가격을 적용한다고 밝혔습니다.

Google은 향후 이 효율성과 품질 개선을 Gemini 앱 전체 사용자에게 제공하고, 몇 달 안에 YouTube 시청 페이지의 Ask YouTube에도 적용할 계획입니다. 구현이 확대되면 동영상 서비스는 단순한 전체 요약을 넘어 질문에 직접 관련된 장면과 근거를 찾아 답하는 방향으로 발전할 수 있습니다. 다만 공개된 수치는 벤치마크와 초기 테스트에 기반하므로, 실제 환경에서는 콘텐츠 유형과 질문 설계에 따른 편차를 고려해야 합니다.

출처: Google DeepMind

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성
비전·비디오
cctest.ai
비전·비디오

Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성

Luce는 기하 구조와 PBR 재질을 통합한 멀티모달 Gaussian 표현을 제안하고, 단일 이미지에서 재조명 가능한 3D 에셋을 생성합니다. PBR Gaussian과 함께 텍스처 메시 및 탄젠트 공간 노멀 맵도 선택적으로 출력할 수 있습니다.

더 보기
CCTest · Blog
고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개
비전·비디오
cctest.ai
비전·비디오

고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개

고덕이 최근 12개 프레임만을 국소 문맥으로 활용해 긴 영상의 3D 장면을 순차적으로 재구성하는 모델 ABot-Recon을 공개했다. 장기 메모리 의존을 없애 장거리 시퀀스에서 발생하는 오차 누적, 속도 저하, 메모리 증가 문제를 줄이는 것이 핵심이다.

더 보기