아티클 목록으로
비전·비디오

ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해

약 3분 소요

배경

멀티모달 대규모 언어 모델이 연속 영상을 이해하려면 단순히 정확하게 보는 것만으로는 부족합니다. 새로운 프레임이 계속 들어오는 동안 긴 시간 안정적으로 처리할 수 있어야 합니다. 자율주행, embodied AI, 산업 모니터링, 감시와 조기 경보, 웨어러블 보조 시스템 등이 대표적인 적용 분야입니다. 그러나 프레임이 들어올 때마다 모델의 모든 층을 반복 실행하면 연산량이 빠르게 누적되고, KV cache도 프리필에 사용한 깊이에 비례해 커집니다.

핵심 아이디어: 먼저 얕게, 필요할 때 깊게

기존 스트리밍 영상 연구는 시각 토큰 가지치기, 토큰 병합, 양자화, 필요 시 프레임 검색, 컨텍스트 오프로딩 등을 통해 비용을 줄여 왔습니다. ShallowStream은 여기에 모델 깊이라는 새로운 최적화 축을 더합니다.

구성은 다음과 같습니다.

  • 스트리밍 단계에서는 얕은 층만 사용합니다. 새 프레임을 얕은 층으로 처리하면서 초기 표현을 만들고, 검색에 활용할 수 있는 정보를 축적합니다.
  • 경량 색인을 계속 유지합니다. 질문이 들어올 때마다 전체 영상과 모든 층을 다시 계산하는 대신, 얕은 층의 KV cache를 사용해 과거 프레임을 관리합니다.
  • 질의 시 프레임을 점수화합니다. 얕은 층에서 생성된 어텐션 점수를 바탕으로 현재 질문과 각 프레임의 관련성을 추정합니다.
  • 다양성을 고려해 증거를 고릅니다. 점수가 높은 프레임만 단순히 선택하지 않고, 서로 다른 정보를 포함하도록 선택해 비슷한 장면이 컨텍스트를 반복해서 차지하는 문제를 줄입니다.

이 방식은 깊은 층을 없애는 접근이 아닙니다. 계속 발생하는 인코딩과 검색 준비는 얕은 층에 맡기고, 실제 답변에 필요한 후보가 정해진 뒤 깊은 층을 사용하는 구조입니다. 다시 말해, 지속적인 관찰에는 가벼운 계산을, 세밀한 이해에는 선택적인 전체 계산을 배정합니다.

보고된 결과와 의미

논문에 따르면 ShallowStream은 기존의 강력한 스트리밍 방법과 비슷한 수준의 성능을 유지하면서 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 낮췄습니다. 전체 깊이의 처리를 매 프레임 반복하지 않기 때문에, 장시간 영상에서 발생하는 계산 부담과 KV cache 증가를 완화할 가능성도 제시합니다.

이 연구의 중요한 점은 스트리밍 추론을 토큰 수만이 아니라 모델 깊이의 배치 문제로 바라본 데 있습니다. 얕은 층은 지속적인 인코딩·압축·후보 탐색을 담당하고, 깊은 층은 선택된 증거를 바탕으로 답변을 생성합니다. 질의 빈도가 일정하지 않은 장기 실행형 비전 시스템에서 특히 유용할 수 있는 설계입니다.

다만 제공된 자료만으로는 전체 실험 설정, 모델 구성, 장면별 오류 분석을 확인할 수 없습니다. 실제 일반화 성능을 평가하려면 원 논문의 세부 결과를 함께 살펴봐야 합니다. 그럼에도 ShallowStream은 스트리밍 영상 시스템의 효율화를 토큰 절감에서 깊이 스케줄링으로 확장했다는 점에서 의미가 있습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행
비전·비디오
cctest.ai
비전·비디오

DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행

arXiv 연구가 동영상 생성 모델의 증류와 인간 선호 정렬을 단일 단계에서 결합하는 DM-Align을 제안했다. 샘플 분포 차이로 선호 유도 그래디언트를 구성해 기존 강화학습 파이프라인의 계산량과 불안정성을 줄이는 것이 목표다.

더 보기
CCTest · Blog
장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까
비전·비디오
cctest.ai
비전·비디오

장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까

장시간 동영상 멀티모달 모델에서 프레임 선택, 공간 압축, 절약한 예산의 재투자를 분리해 비교한 연구가 나왔다. 결과적으로 중요한 것은 프레임을 무조건 선명하게 만드는 것이 아니라, 질문과 관련된 시간적 증거를 더 넓게 확보하는 것으로 나타났다.

더 보기
CCTest · Blog
Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개
비전·비디오
cctest.ai
비전·비디오

Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개

Google DeepMind가 Gemini에 Agentic Video Understanding을 도입했습니다. 모델이 영상, 오디오, 자막을 상황에 맞게 검색하고 다시 확인하며, 공식 벤치마크에서 토큰 사용량은 최대 88%, 비용은 최대 66% 줄고 정확도는 최대 7% 향상됐다고 밝혔습니다.

더 보기