RAG 인덱스를 확장하면 답변이 달라지는 이유
검색 증강 생성(RAG)은 언어 모델과 외부 지식베이스를 결합하는 기술로 설명된다. 따라서 검색 인덱스를 확장하면 더 많은 근거를 얻으면서 기존 질문에 대한 답변은 대체로 유지될 것이라고 기대하기 쉽다. 하지만 Hugging Face Daily Papers에 소개된 연구는 이 가정이 항상 성립하지 않는다고 지적한다. 요청한 모델 식별자, 프롬프트, 검색 정책, 증거 깊이, 출력 형식, 공개된 생성 제어값을 모두 고정해도 코퍼스와 인덱스만 바뀌면 동일한 질문에 다른 답이 나올 수 있다는 것이다.
연구진은 이를 ‘정확도가 포착하지 못하는 답변 churn’으로 설명한다. 일반적인 정확도는 답변이 정답인지 여부만 집계한다. 인덱스 업데이트가 일부 질문은 개선하고 다른 질문은 악화시키면, 상승과 하락이 서로 상쇄돼 전체 점수에는 작은 변화만 나타날 수 있다. 여기에 같은 스냅샷을 반복 실행해도 생성 모델이 서로 다른 답변을 내놓는 변동성이 존재한다. 업데이트 전후를 각각 한 번만 비교하면 자연스러운 생성 잡음을 인덱스 변경의 효과로 잘못 해석할 수 있다.
이 문제를 다루기 위해 연구는 ‘Snapshot Compatibility Audit’, 즉 스냅샷 호환성 감사를 제시한다.
- 동일한 스냅샷에서 답변을 반복 생성해 일반적인 반복 불일치를 측정한다.
- 기존 인덱스와 확장된 인덱스 사이의 답변 차이를 측정한다.
- 교차 스냅샷 불일치에서 동일 스냅샷 반복 불일치를 차감해 업데이트로 인한 추가 churn을 추정한다.
- 문자열 완전 일치뿐 아니라 정규화 정확 일치와 블라인드 의미 평가를 함께 사용한다.
사전 등록된 Natural Questions 400문제 실험에서 연구진은 동결된 FineWeb 프리픽스를 1개 샤드에서 7개 샤드로 확장했다. 추가 churn은 정규화 정확 일치 기준 6.44%포인트, 블라인드 의미 평가 기준 10.25%포인트였다. 반면 정확 일치 정확도 변화는 -1.50%포인트에 불과했다. 사후 분석에서는 400문제 중 40문제에서 반복 실행 시에는 안정적이지만 인덱스가 바뀐 뒤 의미가 달라지는 답변 전환이 확인됐다.
별도로 사전 등록된 TriviaQA 200문제 실험에서도 규모는 더 작았지만 같은 방향의 churn이 관찰됐고, 정확 일치 정확도는 반대 방향으로 움직였다. 또 다른 DeepSeek 생성기와 서빙 설정을 사용한 100문제 결과 비공개 사후 재현에서는 정확 일치 정확도가 3.00%포인트 상승했음에도 의미 기반 추가 churn이 8.75%포인트에 달했다. 이는 인덱스 확장이 항상 품질을 낮춘다는 뜻이 아니다. 정확도와 답변 호환성이 서로 다른 속성이라는 뜻이다.
실무적으로는 RAG 업데이트를 평가할 때 벤치마크 점수만 확인해서는 부족하다. 안정적인 동작이 중요한 제품과 에이전트는 코퍼스 스냅샷, 검색된 근거, 답변 변화, 동일 조건 반복 안정성을 함께 기록해야 한다. 향후 릴리스 보고서에서는 정확도와 호환성을 나란히 제시할 필요가 있다. 새로운 지식을 추가하는 것뿐 아니라 어떤 기존 답변이 바뀌었고 그 변화가 의도된 것인지 설명할 수 있어야 신뢰할 수 있는 RAG 운영이 가능하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…