CANOPY, 멀티모달 RAG의 증거를 질의에 맞게 적응형 압축
멀티모달 검색 증강 생성은 보통 관련 텍스트, 표, 이미지, 동영상을 찾아 생성 모델에 전달하는 과정으로 설명된다. 하지만 검색 결과를 그대로 넣는 방식에는 문제가 있다. 문서 전체나 긴 동영상은 관련 정보와 무관한 내용이 뒤섞여 있고, 반대로 고정된 크기의 작은 조각으로 과도하게 나누면 증거를 해석하는 데 필요한 문맥이 사라질 수 있다. CANOPY는 검색 이후 각 항목에서 얼마만큼을 보존해야 하는지를 다룬다.
주요 작동 방식
- 검색 결과를 계층 구조로 표현한다. 검색된 항목을 원래 영역을 기준으로 여러 수준의 노드로 구성한다. 텍스트라면 문서, 단락, 문장처럼 세분화할 수 있으며, 다른 이종 데이터도 자체적인 영역과 계층을 활용한다. 따라서 모든 항목에 하나의 고정 청크 크기를 적용하지 않아도 된다.
- 증거 중심 노드 점수를 사용한다. 정답 증거를 이용해 미세 조정한 노드 인코더가 질의와 각 영역의 관련도를 평가한다. 목표는 관련 문서를 찾는 데 그치지 않고, 답변을 뒷받침하는 실제 부분을 식별하는 것이다.
- 부모 노드와 비교해 세분화한다. 각 자식 노드를 독립적으로 판단하는 대신 부모 영역과의 상대적인 점수를 비교한다. 넓은 부모 영역은 필요한 배경 문맥으로 남기고, 특히 유용한 자식 영역은 더 세밀한 수준으로 보존할 수 있다. 한 항목 안에서도 서로 다른 세부 수준의 영역이 함께 선택된다. 노드 단위 가지치기를 위해 모든 후보마다 LLM을 호출할 필요가 없다.
- 증거가 부족하면 추가 검색한다. 압축은 처음부터 검색되지 않은 정보를 복원할 수 없다. CANOPY는 critic을 통해 누적된 증거가 충분한지 점검하고, 부족하다고 판단하면 필요한 정보에 초점을 맞춘 후속 검색을 요청한다. 새로 찾은 항목도 먼저 압축한 뒤 독자 모델의 입력에 추가한다.
논문은 3300만 개 이종 항목으로 구성된 코퍼스에서 5개 QA 벤치마크를 사용해 평가했다. CANOPY는 비교 대상 검색 기준선보다 높은 평균 답변 정확도를 달성했다. 또한 Qwen3-VL-8B-Instruct를 독자 모델로 사용한 비라우팅 설정에서, 같은 반복 처리 방식과 비교해 독자 입력 증거 토큰을 14.2~27.7% 줄였다. 논문이 보고한 범위에서는 답변 품질도 비슷한 수준으로 유지됐다. 절제 실험은 멀티홉 QA의 정확도 향상에서 압축 자체보다 추가적인 목표 검색이 중요한 역할을 한다는 점을 보여준다.
의미와 과제
CANOPY의 핵심은 검색과 컨텍스트 관리를 하나의 폐쇄 루프로 연결한 데 있다. 검색은 잠재적인 증거의 범위를 넓히고, 계층적 압축은 각 결과에서 독자 모델에 전달할 양을 조절하며, critic은 초기 검색만으로 증거가 완성되지 않았을 때 이를 보완한다. 텍스트, 표, 동영상마다 별도의 압축 메커니즘을 두는 방식보다 다양한 데이터 유형에 공통으로 적용할 수 있는 절차에 가깝다.
다만 성능은 초기 검색기가 핵심 증거를 찾아내는지, 그리고 계층 구조가 데이터의 의미 있는 단위를 잘 표현하는지에 영향을 받는다. 후속 검색은 멀티홉 질문의 누락된 증거를 보완할 수 있지만 계산량과 지연을 추가한다. 따라서 CANOPY는 토큰을 무조건 줄이는 기법이라기보다, 증거의 완전성·입력 컨텍스트 크기·검색 비용 사이의 균형을 동적으로 조정하는 프레임워크로 이해하는 편이 적절하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…