비전 인코더는 사라질까? 멀티모달 모델 확장 법칙의 새로운 시사점
들어가며
오늘날 많은 멀티모달 대규모 언어 모델은 사전학습된 비전 인코더를 사용한다. 이미지가 먼저 시각 특징으로 변환된 뒤 언어 모델에 전달되는 방식이다. 이 구조는 강력한 시각적 사전 지식을 제공해 학습을 안정적으로 만들 수 있지만, 시각 모듈과 언어 모듈을 별도 구성요소로 유지해야 한다는 부담도 있다.
비전 인코더가 없는 멀티모달 모델은 원시 픽셀에서 직접 시각 표현을 학습한다. 구조가 단순하고 통합적이라는 장점이 있지만, 모델 규모와 학습 연산량이 커질 때 기존 방식과 어떤 차이를 보이는지는 충분히 정리되지 않았다. Tencent Hunyuan 연구팀은 두 구조를 비교해 이러한 확장 특성을 분석했다.
핵심 내용
- 텍스트 학습에서는 큰 차이가 나타나지 않았다. 텍스트 목표에서 두 구조의 손실-연산량 프런티어는 거의 겹쳤다. 비전 인코더를 제거한다고 해서 언어 모델링 능력이 본질적으로 약화되는 것은 아니라는 의미다.
- 멀티모달 목표에서는 더 큰 모델이 필요하다. 인코더 없는 구조는 멀티모달 학습의 최적 연산 배분이 더 큰 모델을 선호하는 방향으로 이동한다. 모델이 외부 인코더의 도움 없이 시각 표현까지 직접 습득해야 하기 때문이다.
- 초기 성능 격차는 줄어들 수 있다. 작은 규모에서는 사전학습된 시각적 사전 지식을 활용하는 모델이 유리하다. 그러나 연구는 약 10^22 FLOPs의 학습 연산량에서 인코더 없는 모델이 따라잡을 가능성을 예측했다. 연구진은 이 수준이 실제 사전학습 예산에서도 도달 가능한 범위라고 설명한다.
- 언어 모델이 인코더 역할을 일부 대신한다. 학습 연산량이 증가할수록 시각 토큰 사이의 양방향 상호작용이 더 유용해졌다. 시각 처리는 더 이른 층으로 이동했고, 시각 토큰에 대한 전문가 라우팅은 더욱 집중됐다. 이는 언어 모델 내부에 시각 정보 전용 처리 경로가 형성된다는 해석을 뒷받침한다.
의미와 한계
이번 결과가 비전 인코더의 즉각적인 퇴장을 뜻하는 것은 아니다. 중소규모 학습에서는 사전학습된 인코더가 데이터 효율, 초기화, 시스템 안정성 측면에서 여전히 유리할 수 있다. 또한 약 10^22 FLOPs라는 수치는 확장 분석을 바탕으로 한 예측이며, 모든 데이터셋과 하위 작업에서 같은 전환점이 나타난다는 의미는 아니다.
그럼에도 연구의 핵심 시사점은 분명하다. 사전학습된 시각적 사전 지식의 상대적 이점은 모델 규모가 커질수록 감소할 수 있다. 작은 모델에서는 강력한 인코더를 연결하는 것이 효율적인 지름길이지만, 충분한 파라미터와 데이터, 연산량이 주어지면 하나의 언어 모델이 시각 표현을 스스로 학습할 여지가 커진다.
앞으로 멀티모달 사전학습의 경쟁은 더 강한 비전 인코더를 연결하는 문제에만 머물지 않을 수 있다. 원시 입력에서 시각 능력을 효율적으로 습득하도록 모델 구조와 학습 방식을 설계하는 일이 중요해질 전망이다. 인코더 없는 구조는 구성요소 간 결합을 줄이고 종단 간 최적화를 단순화할 가능성이 있지만, 실제 도입을 위해서는 하위 작업 성능과 총 학습 비용에 대한 추가 검증이 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…