아티클 목록으로
RAG·검색

GLIE, 소수 벡터로 시각 문서 검색 표현을 재구성하다

약 3분 소요

배경

시각 문서 검색은 문장 내용만 비교하지 않는다. 표와 이미지, 레이아웃, 페이지의 특정 영역도 질의와 문서의 관련성에 영향을 준다. 후기 상호작용 검색기는 페이지를 다수의 벡터로 표현한 뒤, 질의 벡터와 페이지 벡터를 MaxSim 방식으로 세밀하게 비교한다. 하지만 일반적으로 한 페이지에 약 1,000개의 벡터가 필요해 문서 규모가 커질수록 인덱스 저장 비용이 빠르게 증가한다.

논문은 이 문제를 해결하기 위해 Generative Late-Interaction Embeddings, 즉 GLIE를 제안한다. GLIE는 문서 인코더를 다시 학습하지 않고, 원래 벡터를 단순히 버리거나 평균내는 대신 적은 수의 벡터로 페이지의 핵심 구조를 저장한다. 이후 검색 가능성이 높은 후보에 대해서만 더 완전한 표현을 생성한다.

핵심 내용

  • 벡터의 기하학적 특성을 분석했다. 세 가지 인코더를 대상으로 조사한 결과, 페이지 벡터는 정확히 단위 구면 위에 놓이며 내재 차원이 약 5~6인 다양체 주변에 집중됐다. 즉, 벡터 개수는 많지만 독립적인 정보의 자유도는 상대적으로 낮다는 의미다.
  • k-means 중심을 그대로 사용하지 않는다. 일반적인 k-means 중심은 구 내부에 위치하지만 원래 벡터는 구면 위에 있다. 이 중심을 그대로 사용하면 MaxSim 점수가 체계적으로 낮게 계산될 수 있다. 중심을 다시 구면 표면으로 정규화했을 때, 정규화하지 않은 중심보다 nDCG@5가 최대 0.093 향상됐다.
  • 압축 코드를 검색과 생성에 모두 활용한다. GLIE는 페이지마다 원래보다 훨씬 적은 k개의 벡터를 학습한다. 이 벡터들은 가벼운 검색 인덱스로 사용되는 동시에, 전체 페이지 임베딩을 복원하는 디코더의 입력 기반이 된다. 문서 인코더는 고정하고 작은 리파이너와 디코더만 학습한다.
  • 비싼 계산을 상위 후보에 한정한다. 먼저 압축 코드만으로 검색한 뒤, 보고된 평가에서는 상위 20개 후보만 확장한다. 이후 복원된 표현을 사용해 MaxSim 기반의 정확한 재순위화를 수행한다.

결과와 영향

ViDoRe v1에서 페이지당 4개의 벡터만 저장했을 때 GLIE는 비압축 시스템 nDCG@5의 거의 80%를 유지했다. 같은 비교에서 가장 좋은 기존 후처리 압축 방식은 약 70%를 유지했다. 추가 네트워크의 규모는 415K 파라미터로, 대형 보조 모델에 의존하지 않는다는 점도 눈에 띈다.

이 연구의 핵심 의의는 다중 벡터 검색의 압축 방식을 다시 바라보게 한다는 데 있다. 압축 표현은 원래 벡터의 일부를 남기거나 지역 평균을 저장하는 데 그치지 않고, 필요할 때 세부 표현을 재생성하는 좌표계가 될 수 있다. 따라서 전체 문서에 높은 계산 비용을 적용하지 않고, 검색 상위 후보에만 복원과 정밀 재평가를 집중할 수 있다.

다만 성능은 사용한 인코더와 데이터셋, 페이지당 벡터 수, 후보 확장 범위에 따라 달라질 수 있다. 실제 서비스에서는 저장 공간 절감과 디코딩 시간, 검색 재현율 사이의 균형을 별도로 검증해야 한다. 그럼에도 GLIE는 제한된 저장 예산 안에서 후기 상호작용 검색의 세밀한 표현력을 유지하려는 실용적인 방향을 제시한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
답변 전에 ‘답할 수 있는지’ 판단하는 신뢰할 수 있는 RAG
RAG·검색
cctest.ai
RAG·검색

답변 전에 ‘답할 수 있는지’ 판단하는 신뢰할 수 있는 RAG

RAG의 문제는 검색 정보가 부족할 때만 발생하지 않습니다. 검색된 문서가 서로 충돌할 수도 있기 때문입니다. 새로운 연구는 언어 모델의 내부 신호를 해독해 생성 전에 답변 가능, 정보 부족, 정보 충돌을 구분하는 방법을 제시합니다.

더 보기
CCTest · Blog
검색은 좋아졌지만 견고성은 약해졌다: 멀티홉 RAG가 ASR 오류를 키우는 방식
RAG·검색
cctest.ai
RAG·검색

검색은 좋아졌지만 견고성은 약해졌다: 멀티홉 RAG가 ASR 오류를 키우는 방식

음성 기반 멀티홉 질의응답에서 더 풍부한 검색 구조가 절대 성능은 높이지만, 상류 음성인식 오류에는 오히려 더 취약할 수 있다는 연구 결과가 나왔다. 특히 질의 속 엔터티가 잘못 인식되는 현상이 오류 전파의 핵심 원인으로 나타났다.

더 보기