아티클 목록으로
추론·배포

OmniScope: 오디오와 비디오 중요도를 분리한 OmniLLM 토큰 압축

약 3분 소요

도입

옴니모달 대형 언어 모델은 텍스트뿐 아니라 영상과 오디오까지 함께 이해해야 합니다. 하지만 오디오-비디오 입력은 많은 토큰을 만들고, 이는 추론의 prefill 단계를 느리게 하며 GPU 메모리 사용량을 키웁니다. 따라서 어떤 토큰을 남기고 어떤 토큰을 줄일지 결정하는 압축 기술은 실제 배포에서 매우 중요한 문제입니다.

OmniScope 논문은 기존 토큰 압축 방식의 한계를 짚습니다. 많은 방법은 한 모달리티를 기준으로 다른 모달리티의 중요도를 판단합니다. 예를 들어 영상 단서를 이용해 오디오 토큰을 줄이거나, 반대로 오디오 단서를 이용해 영상 토큰을 선택하는 식입니다. 논문은 이러한 단방향 안내가 항상 안전하지 않다고 봅니다.

핵심 내용

  • 오디오와 비디오의 중요한 순간은 다를 수 있음: 같은 질문에 대해 답에 필요한 소리와 화면 정보가 서로 다른 시간대에서 가장 중요해질 수 있습니다. 이 경우 한 모달리티의 중요도만 따라가면 정답에 필요한 단서를 삭제할 위험이 있습니다.
  • 질의는 공유하되 중요도는 분리: OmniScope는 사용자 질의를 공통 의미 앵커로 사용하지만, 오디오와 비디오의 관련성은 각각 따로 추정합니다.
  • 모달리티별 토큰 예산 배정: 모든 토큰을 한꺼번에 자르는 대신, 오디오와 비디오에 맞는 별도 보존 예산을 둡니다.
  • 영상은 anchor-delta 전략 사용: 시각 토큰 압축에서는 전체 맥락과 시간에 따른 변화 정보를 모두 보존하려고 합니다.
  • 오디오는 초 단위 병합으로 중복 감소: 오디오 토큰은 각 1초 구간 안에서 병합해 중복을 줄이면서 시간적 연속성을 유지합니다.

의미와 영향

논문에 따르면 OmniScope는 네 개의 오디오-비디오 벤치마크와 두 가지 Qwen2.5-Omni 모델 규모에서 평가되었고, 여러 압축 설정 전반에서 가장 높은 평균 정확도를 기록했습니다. 전체 토큰의 25%만 유지하는 조건에서는 최대 3.53배의 prefill 속도 향상과 15% 이상의 GPU 메모리 절감을 보였으며, 평균 정확도 하락은 0.35점에 그쳤습니다.

이 결과가 주는 메시지는 분명합니다. 옴니모달 추론에서 질의는 여러 모달리티를 연결하는 공통 기준이 될 수 있지만, 오디오와 비디오의 중요도 판단까지 하나로 묶어서는 안 됩니다. 시간적으로 동기화된 입력이라도, 답에 필요한 정보가 드러나는 시점은 다를 수 있기 때문입니다.

또한 OmniScope가 학습을 요구하지 않는다는 점은 실용적입니다. 모델을 다시 학습하지 않고도 추론 비용을 줄일 수 있다면, 긴 영상 이해나 실시간 오디오-비디오 상호작용, 제한된 GPU 환경에서 활용 가능성이 커집니다. 다만 현재 소재는 주로 요약 정보에 기반하므로, 세부 구현과 작업별 성능 차이는 원문과 코드 확인이 필요합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
투기적 디코딩의 손실 검증 재검토: 더 빠른 추론이 바꾸는 생성 분포
추론·배포
cctest.ai
추론·배포

투기적 디코딩의 손실 검증 재검토: 더 빠른 추론이 바꾸는 생성 분포

이 논문은 투기적 디코딩에서 손실 검증이 효율을 높이는 동시에 모델의 디코딩 분포를 바꿀 수 있음을 분석한다. 검증을 느슨하게 하는 방식은 속도 향상뿐 아니라 품질 저하 위험도 함께 가져온다.

더 보기