Mage-VL: 실시간 영상 이해를 위한 코덱 네이티브 멀티모달 모델
도입
시각언어모델은 정지 이미지나 오프라인 영상 클립을 대상으로 한 복잡한 추론에서는 빠르게 발전해 왔습니다. 하지만 실시간 영상 스트림에서는 문제가 달라집니다. 프레임을 균일하게 샘플링하고 같은 밀도로 인코딩하면, 거의 변하지 않는 배경이나 정보량이 낮은 영역에도 많은 계산을 쓰게 됩니다.
Mage-VL은 이 병목을 모델 크기만으로 해결하려 하지 않습니다. 대신 영상 코덱이 이미 계산하는 모션 벡터, 잔차 에너지, I 프레임과 P 프레임의 관계를 활용해 중요한 시각 영역을 선별합니다. 즉, 영상을 단순한 이미지의 나열이 아니라 압축 구조를 가진 시간적 신호로 다루는 접근입니다.
핵심 포인트
- Mage-ViT 토크나이저: 균일 프레임 샘플링을 대체하고, 16×16 패치 단위에서 동적이며 엔트로피가 높은 영역을 선택적으로 인코딩합니다.
- 시각 토큰 절감: 논문은 시공간 맥락을 유지하면서 시각 토큰 소비를 75% 이상 줄일 수 있다고 설명합니다. 이는 긴 영상과 실시간 상호작용에서 특히 중요합니다.
- 비라벨 데이터 기반 학습: Mage-ViT는 약 5억 6천만 장의 비라벨 이미지와 1억 프레임의 비라벨 영상으로 처음부터 학습되었습니다. 저자들은 이 인코더가 수십억 이미지-텍스트 쌍으로 학습된 대표 인코더와 맞먹거나 더 나은 성능을 낸다고 주장합니다.
- 이중 시스템 구조: 가벼운 System 1 이벤트 게이트와 인과적 System 2 디코더를 결합해, 단순한 배치 분석이 아니라 능동적인 스트리밍 지각을 지원하도록 설계했습니다.
- 평가 결과: Mage-VL-4B는 정적 과제에서 Qwen3-VL-4B와 비슷한 성능을 보이고, 영상 이해와 2D/3D 공간 추론에서 개선을 보이며, 최대 3.5배의 실제 추론 시간 단축을 달성했다고 보고됩니다.
의미와 영향
Mage-VL의 중요한 메시지는 입력 표현을 다시 설계하면 멀티모달 모델의 효율을 크게 바꿀 수 있다는 점입니다. 영상 압축 과정은 안정적인 배경, 움직임, 예측 오차를 자연스럽게 드러냅니다. 이 신호를 모델이 직접 활용하면 제한된 토큰 예산을 더 의미 있는 부분에 배분할 수 있습니다.
이 접근은 실시간 AI 비서, 로봇 인식, 보안 영상 분석, 차량 내 인터랙션, 장시간 영상 이해에 영향을 줄 수 있습니다. 앞으로의 멀티모달 모델은 단순히 더 큰 파라미터나 더 높은 벤치마크 점수만이 아니라, 데이터 파이프라인, 토큰 예산, 아키텍처, 추론 지연을 함께 최적화하는 방향으로 평가될 가능성이 큽니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…