V-CoLA: 선형 어텐션을 위한 비전 토큰 압축
배경
비전 언어 모델(VLM)은 이미지와 텍스트를 함께 처리하지만, 이미지가 많은 수의 비전 토큰으로 변환되면서 입력 시퀀스가 빠르게 길어진다. 비전 토큰은 모델 입력에서 큰 비중을 차지할 수 있으며, 결과적으로 추론 과정의 연산량과 메모리 사용량을 증가시킨다. 중요한 시각 정보를 보존하면서 토큰 수를 줄이는 기술이 멀티모달 모델의 효율성을 높이는 핵심 방법으로 주목받는 이유다.
논문 ‘V-CoLA: Vision Token Compression with Linear Attention’은 이 문제를 선형 어텐션 환경에 맞춰 다시 살펴본다. 기존의 여러 비전 토큰 압축 기법은 Softmax 어텐션을 중심으로 설계됐다. 그러나 Qwen3.5와 같이 선형 어텐션을 포함하는 하이브리드 구조가 등장하면서, 어텐션 점수나 특징 유사도에 기반한 기존 기준을 그대로 적용하기 어려워졌다. 논문은 이런 방식들이 선형 어텐션 환경에서 뚜렷한 성능 저하를 보일 수 있다고 분석한다.
V-CoLA의 핵심 구성
V-CoLA는 추가 학습 없이 사용할 수 있는 압축 프레임워크다. 주요 아이디어는 다음과 같다.
- 독창성을 반영한 중요도 평가: 단순히 눈에 띄거나 다른 토큰과 유사한 정도만 평가하지 않는다. 다른 토큰이 반복하지 않는 정보를 담고 있는지도 함께 고려한다. 주변 토큰과 비슷하지 않더라도 특정 물체나 세부 장면을 나타내는 토큰은 유지할 가치가 있을 수 있다.
- 적응형 토큰 병합: 압축 대상 토큰을 무조건 삭제하는 대신 정보를 병합한다. 이를 통해 시퀀스 길이를 줄이면서도 시각 콘텐츠의 전체적인 표현을 유지하려고 한다.
- 청크 병렬 처리와의 호환성: 선형 어텐션에서 활용되는 청크 단위 병렬 처리에 맞도록 구성 요소를 구현 수준에서 최적화한다. 알고리즘상 토큰 수를 줄이는 것뿐 아니라 실제 실행 과정에서 속도 향상이 발생하도록 고려한 설계다.
실험에서 보고된 성능
여러 벤치마크에서 V-CoLA는 비전 토큰의 50%만 남겼을 때 원래 모델 성능의 99.5%를 달성했다고 보고됐다. 토큰을 원래의 12.5%까지 줄였을 때도 성능은 88%를 넘었다. 프리필 단계의 속도 향상 폭은 1.86배에서 6.15배로 제시됐다.
이 결과는 시각 입력에 상당한 중복 정보가 존재할 수 있음을 보여준다. 동시에 어떤 정보가 중요한지를 판별하는 기준은 모델의 어텐션 구조와 무관하지 않다는 점도 시사한다. 단순한 삭제보다 중복 정보와 고유 정보를 구분하는 방식이 성능 보존에 더 적합할 수 있다.
의미와 한계
V-CoLA의 중요한 점은 비전 토큰 압축을 모든 모델에 동일하게 적용하는 문제가 아니라, 어텐션 구조에 맞춰 설계해야 하는 문제로 본다는 데 있다. 선형 어텐션과 Softmax 어텐션이 함께 사용되는 모델에서는 하나의 선택 규칙만으로 안정적인 압축을 달성하기 어려울 수 있다. 추가 학습이 필요 없다는 점은 기존 모델과 추론 시스템에 적용할 때의 진입 장벽을 낮춘다.
다만 제공된 요약만으로는 모든 비전 인코더와 작업, 모델 계열에서의 성능을 판단하기 어렵다. 압축률별 정확도 변화와 다양한 구조에서의 안정성은 후속 실험을 통해 더 확인할 필요가 있다. 그럼에도 V-CoLA는 멀티모달 모델의 프리필 비용을 낮추기 위한 실용적인 연구 방향을 제시한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…