아티클 목록으로
멀티모달

Mage-VL: 실시간 영상 이해를 위한 코덱 네이티브 멀티모달 모델

약 3분 소요

도입

시각언어모델은 정지 이미지나 오프라인 영상 클립을 대상으로 한 복잡한 추론에서는 빠르게 발전해 왔습니다. 하지만 실시간 영상 스트림에서는 문제가 달라집니다. 프레임을 균일하게 샘플링하고 같은 밀도로 인코딩하면, 거의 변하지 않는 배경이나 정보량이 낮은 영역에도 많은 계산을 쓰게 됩니다.

Mage-VL은 이 병목을 모델 크기만으로 해결하려 하지 않습니다. 대신 영상 코덱이 이미 계산하는 모션 벡터, 잔차 에너지, I 프레임과 P 프레임의 관계를 활용해 중요한 시각 영역을 선별합니다. 즉, 영상을 단순한 이미지의 나열이 아니라 압축 구조를 가진 시간적 신호로 다루는 접근입니다.

핵심 포인트

  • Mage-ViT 토크나이저: 균일 프레임 샘플링을 대체하고, 16×16 패치 단위에서 동적이며 엔트로피가 높은 영역을 선택적으로 인코딩합니다.
  • 시각 토큰 절감: 논문은 시공간 맥락을 유지하면서 시각 토큰 소비를 75% 이상 줄일 수 있다고 설명합니다. 이는 긴 영상과 실시간 상호작용에서 특히 중요합니다.
  • 비라벨 데이터 기반 학습: Mage-ViT는 약 5억 6천만 장의 비라벨 이미지와 1억 프레임의 비라벨 영상으로 처음부터 학습되었습니다. 저자들은 이 인코더가 수십억 이미지-텍스트 쌍으로 학습된 대표 인코더와 맞먹거나 더 나은 성능을 낸다고 주장합니다.
  • 이중 시스템 구조: 가벼운 System 1 이벤트 게이트와 인과적 System 2 디코더를 결합해, 단순한 배치 분석이 아니라 능동적인 스트리밍 지각을 지원하도록 설계했습니다.
  • 평가 결과: Mage-VL-4B는 정적 과제에서 Qwen3-VL-4B와 비슷한 성능을 보이고, 영상 이해와 2D/3D 공간 추론에서 개선을 보이며, 최대 3.5배의 실제 추론 시간 단축을 달성했다고 보고됩니다.

의미와 영향

Mage-VL의 중요한 메시지는 입력 표현을 다시 설계하면 멀티모달 모델의 효율을 크게 바꿀 수 있다는 점입니다. 영상 압축 과정은 안정적인 배경, 움직임, 예측 오차를 자연스럽게 드러냅니다. 이 신호를 모델이 직접 활용하면 제한된 토큰 예산을 더 의미 있는 부분에 배분할 수 있습니다.

이 접근은 실시간 AI 비서, 로봇 인식, 보안 영상 분석, 차량 내 인터랙션, 장시간 영상 이해에 영향을 줄 수 있습니다. 앞으로의 멀티모달 모델은 단순히 더 큰 파라미터나 더 높은 벤치마크 점수만이 아니라, 데이터 파이프라인, 토큰 예산, 아키텍처, 추론 지연을 함께 최적화하는 방향으로 평가될 가능성이 큽니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SpatialBlock, 합성 블록 쌓기로 비전 언어 모델의 공간 지능을 훈련하다
멀티모달
cctest.ai
멀티모달

SpatialBlock, 합성 블록 쌓기로 비전 언어 모델의 공간 지능을 훈련하다

SpatialBlock은 비용이 크고 노이즈가 발생하기 쉬운 실제 장면의 기하 주석 대신, 합성 블록 쌓기 문제로 대규모 비전 언어 모델의 공간 추론을 훈련하는 방법을 제안한다. SpatialBlock-15k는 3D 투영, 시점 변환, 구조 결합과 색상 기반 공간 앵커를 다룬다.

더 보기
CCTest · Blog
SenseNova-U1.5, 시각 이해와 생성을 하나로 묶은 8B 모델
멀티모달
cctest.ai
멀티모달

SenseNova-U1.5, 시각 이해와 생성을 하나로 묶은 8B 모델

SenseNova-U1.5는 비전 인코더와 VAE 없이 시각 콘텐츠의 이해, 추론, 생성을 수행하도록 설계된 8B-MoT 네이티브 통합 멀티모달 모델입니다. 논문은 이미지 충실도, 문자 렌더링, 복잡한 구성, 다중 참조 편집의 개선을 보고합니다.

더 보기