Ovis-Embedding, 텍스트·이미지·영상·음성을 하나의 의미 공간으로
들어가며
실제 검색 시스템의 정보는 하나의 모달리티로만 구성되지 않는 경우가 많다. 상품 설명은 이미지나 영상과 연결되고, 음성 콘텐츠는 텍스트 또는 시각 정보로 검색될 수 있다. 기존에는 모달리티마다 별도 인코더를 만든 뒤 결과 표현을 정렬하는 방식이 널리 사용됐다. 이 방식은 각 모달리티의 특성을 살릴 수 있지만 학습과 배포, 통합 검색 구조를 복잡하게 만들 수 있다.
Hugging Face Daily Papers에 소개된 Ovis-Embedding은 공유 멀티모달 백본을 이용해 텍스트, 이미지, 영상, 음성을 공통 표현 공간에 인코딩한다. 단순히 지원 모달리티를 늘리는 데 그치지 않고, 옴니모달 임베딩을 위한 데이터 설계와 학습 목적, 추론 최적화를 함께 다룬다는 점이 특징이다.
핵심 내용
- 네이티브 옴니모달 초기화. 사전학습된 Qwen-omni를 임베딩 백본으로 채택하고 대조 학습으로 조정한다. 저랭크 초기화를 활용해 범용 멀티모달 모델을 유사도 학습에 적합한 형태로 전환한다.
- 데이터 중심 학습. 텍스트, 이미지, 영상, 음성, 모달리티가 교차된 데이터를 포함하는 코퍼스를 구성한다. 동질 소스 샘플링으로 과제 특성이 일관된 배치를 만들고, 배치 내 음성 샘플의 정보량을 높인다.
- 임베딩 전용 최적화. 포컬 손실은 어려운 사례에 더 큰 비중을 둔다. 유사도 기반 Embedding Distillation은 상호 보완적인 전문가 모델이 가진 세밀한 유사도 구조를 전달한다.
- 유연한 추론 차원. 저랭크 특징 분해를 통해 임베딩 차원을 조절할 수 있다. 저장 공간과 검색 비용, 표현 성능 사이의 균형을 서비스 목적에 맞게 선택할 수 있도록 하는 접근이다.
의미와 영향
Ovis-Embedding의 의미는 네 가지 모달리티를 하나의 모델에 넣었다는 데만 있지 않다. 공유 백본으로 모달리티 간 분리를 줄이고, 샘플링과 손실 함수, 증류를 통해 과제별 차이를 다루는 통합 임베딩 설계 방향을 보여준다. 크로스모달 검색, 추천, 미디어 이해, 멀티모달 지식베이스에서는 데이터 유형마다 별도 검색 모델을 유지해야 하는 부담을 줄일 가능성이 있다.
다만 제공된 요약에는 모델 규모, 학습 데이터의 세부 구성, 각 벤치마크의 구체적인 점수가 포함되어 있지 않다. MMEB-v3, MMEB-v2, MVEB, MAEB, RTEB의 결과는 접근법의 가능성을 뒷받침하지만 모든 운영 환경에서의 성능을 보장하는 결론은 아니다. 여러 모달리티를 조합한 질의, 긴 영상, 복잡한 음성, 저차원 임베딩을 활용한 대규모 검색에서 추가 검증이 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…