아티클 목록으로
RAG·검색

문서 수준 어텐션 붕괴로 RAG 포이즈닝을 탐지한다

약 3분 소요

들어가며

검색 증강 생성(RAG)은 대규모 언어 모델이 최신 정보나 기업 내부 문서를 활용하도록 만드는 핵심 방식이 됐다. 그러나 검색 대상 코퍼스나 검색 결과에 악성 문서를 삽입하면, 공격자는 모델의 답변 방향을 바꿀 수 있다. 검색 계층이 새로운 공격 표면이 되는 셈이다.

문제는 공격받은 답변이 항상 불안정하게 보이지 않는다는 데 있다. 질문과 주변 문맥에 정교하게 맞춘 오염 문서는 모델이 틀린 내용을 더 높은 확신으로 출력하게 만들 수 있다. “When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse”라는 연구는 최종 답변만 확인하는 대신, 생성 과정에서 모델이 어떤 문서에 의존하는지 살펴봐야 한다고 주장한다.

핵심 내용

  • 출력 불확실성만으로는 공격을 잡기 어렵다. 기존 탐지 기법은 주로 퍼플렉서티나 답변 일관성 같은 출력 측 신호를 사용한다. 하지만 공격 문서가 질문과 자연스럽게 연결되도록 설계되면, 오염된 답변의 퍼플렉서티가 정상 답변보다 낮아질 수도 있다. 낮은 불확실성이 곧 신뢰성을 의미하지는 않는다.
  • 문서에 대한 어텐션 분포가 달라진다. 정상적인 생성에서는 여러 관련 문서에 어텐션이 분산될 수 있다. 반면 공격 상황에서는 모델의 어텐션이 악성 문서로 점점 집중되고, 문서 수준 어텐션 엔트로피가 감소한다. 논문은 이 현상을 “Attention Collapse”, 즉 어텐션 붕괴라고 부른다.
  • D-SCAN은 생성 내부 신호를 분석한다. D-SCAN(Document-level Signal Collapse Analysis)은 검색된 각 문서에 할당되는 어텐션 신호를 추적하고, 생성 중 그 변화 양상을 분석하는 경량 탐지 프레임워크다. 최종 텍스트의 표면적 특징에만 의존하지 않는 것이 핵심이다.
  • 답변이 바뀌지 않아도 경고할 수 있다. 논문에 따르면 D-SCAN은 공격으로 최종 답변이 달라진 경우뿐 아니라, 답변은 그대로여도 모델의 문서 의존성이 이미 악성 문서 쪽으로 기울어진 경우를 탐지할 수 있다.

의미와 한계

이 연구는 RAG 보안을 “결과 검사”에서 “생성 과정 검사”로 확장한다. 답변이 맞아 보이더라도, 악성 문서가 모델에 불균형적인 영향력을 행사했다면 이후 질문에서 문제가 드러날 수 있다. 문서 수준 어텐션의 비정상적인 집중은 출처 재검토나 추가 검증을 시작하게 하는 보조 신호가 될 수 있다.

다만 어텐션을 모델 행동의 완전한 인과 설명으로 해석해서는 안 된다. 모델 구조, 프롬프트 형식, 문서 순서와 구현 방식에 따라 어텐션 패턴은 달라질 수 있다. 다중 턴 대화나 에이전트형 RAG 환경에서 D-SCAN이 얼마나 안정적으로 작동하는지는 추가 검증이 필요하다. 실제 배포에서는 출처 인증, 문서 중복 제거, 내용 일관성 검사, 출력 감사와 함께 여러 방어 신호 중 하나로 활용하는 편이 적절하다.

RAG 방어가 던져야 할 질문은 “답변이 맞는가”에 그치지 않는다. “모델은 어느 문서를 가장 신뢰했으며, 왜 그렇게 확신했는가”까지 확인해야 한다.

Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
DeepVoyager-VL: 시각 정보를 추론 루프에 넣은 장기 멀티모달 검색
RAG·검색
cctest.ai
RAG·검색

DeepVoyager-VL: 시각 정보를 추론 루프에 넣은 장기 멀티모달 검색

DeepVoyager-VL은 이미지를 처음에만 보는 방식에서 벗어나, 시각 증거가 검색과 중간 추론을 계속 이끄는 구조를 제안합니다. 긴 정보 탐색 과정에서 텍스트와 이미지를 반복적으로 활용하는 점이 핵심입니다.

더 보기
CCTest · Blog
UEmbed: 희소 검색과 조밀 임베딩을 하나의 멀티모달 디코더로 통합
RAG·검색
cctest.ai
RAG·검색

UEmbed: 희소 검색과 조밀 임베딩을 하나의 멀티모달 디코더로 통합

Alibaba-NLP의 UEmbed는 decoder-only 멀티모달 임베딩 모델로, 한 번의 인과적 forward pass에서 희소 어휘 표현과 조밀 벡터를 함께 생성한다. 검색, RAG, 멀티모달 검색에서 분리되어 있던 표현 체계를 통합하려는 시도다.

더 보기