아티클 목록으로
RAG·검색

문서 수준 어텐션 붕괴로 RAG 포이즈닝을 탐지한다

약 3분 소요

들어가며

검색 증강 생성(RAG)은 대규모 언어 모델이 최신 정보나 기업 내부 문서를 활용하도록 만드는 핵심 방식이 됐다. 그러나 검색 대상 코퍼스나 검색 결과에 악성 문서를 삽입하면, 공격자는 모델의 답변 방향을 바꿀 수 있다. 검색 계층이 새로운 공격 표면이 되는 셈이다.

문제는 공격받은 답변이 항상 불안정하게 보이지 않는다는 데 있다. 질문과 주변 문맥에 정교하게 맞춘 오염 문서는 모델이 틀린 내용을 더 높은 확신으로 출력하게 만들 수 있다. “When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse”라는 연구는 최종 답변만 확인하는 대신, 생성 과정에서 모델이 어떤 문서에 의존하는지 살펴봐야 한다고 주장한다.

핵심 내용

  • 출력 불확실성만으로는 공격을 잡기 어렵다. 기존 탐지 기법은 주로 퍼플렉서티나 답변 일관성 같은 출력 측 신호를 사용한다. 하지만 공격 문서가 질문과 자연스럽게 연결되도록 설계되면, 오염된 답변의 퍼플렉서티가 정상 답변보다 낮아질 수도 있다. 낮은 불확실성이 곧 신뢰성을 의미하지는 않는다.
  • 문서에 대한 어텐션 분포가 달라진다. 정상적인 생성에서는 여러 관련 문서에 어텐션이 분산될 수 있다. 반면 공격 상황에서는 모델의 어텐션이 악성 문서로 점점 집중되고, 문서 수준 어텐션 엔트로피가 감소한다. 논문은 이 현상을 “Attention Collapse”, 즉 어텐션 붕괴라고 부른다.
  • D-SCAN은 생성 내부 신호를 분석한다. D-SCAN(Document-level Signal Collapse Analysis)은 검색된 각 문서에 할당되는 어텐션 신호를 추적하고, 생성 중 그 변화 양상을 분석하는 경량 탐지 프레임워크다. 최종 텍스트의 표면적 특징에만 의존하지 않는 것이 핵심이다.
  • 답변이 바뀌지 않아도 경고할 수 있다. 논문에 따르면 D-SCAN은 공격으로 최종 답변이 달라진 경우뿐 아니라, 답변은 그대로여도 모델의 문서 의존성이 이미 악성 문서 쪽으로 기울어진 경우를 탐지할 수 있다.

의미와 한계

이 연구는 RAG 보안을 “결과 검사”에서 “생성 과정 검사”로 확장한다. 답변이 맞아 보이더라도, 악성 문서가 모델에 불균형적인 영향력을 행사했다면 이후 질문에서 문제가 드러날 수 있다. 문서 수준 어텐션의 비정상적인 집중은 출처 재검토나 추가 검증을 시작하게 하는 보조 신호가 될 수 있다.

다만 어텐션을 모델 행동의 완전한 인과 설명으로 해석해서는 안 된다. 모델 구조, 프롬프트 형식, 문서 순서와 구현 방식에 따라 어텐션 패턴은 달라질 수 있다. 다중 턴 대화나 에이전트형 RAG 환경에서 D-SCAN이 얼마나 안정적으로 작동하는지는 추가 검증이 필요하다. 실제 배포에서는 출처 인증, 문서 중복 제거, 내용 일관성 검사, 출력 감사와 함께 여러 방어 신호 중 하나로 활용하는 편이 적절하다.

RAG 방어가 던져야 할 질문은 “답변이 맞는가”에 그치지 않는다. “모델은 어느 문서를 가장 신뢰했으며, 왜 그렇게 확신했는가”까지 확인해야 한다.

Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
ScholarCatalyst: AI는 새 연구를 촉발할 논문을 찾을 수 있을까
RAG·검색
cctest.ai
RAG·검색

ScholarCatalyst: AI는 새 연구를 촉발할 논문을 찾을 수 있을까

ScholarCatalyst는 단순히 주제가 비슷한 논문이 아니라, 특정 연구 프로젝트를 실제로 발전시킬 수 있는 논문을 검색하는 능력을 평가합니다. 저자들의 판단을 기반으로 한 실험에서 현재의 AI 에이전트는 전문가 수준에 미치지 못했습니다.

더 보기
CCTest · Blog
D-RAC, 멀티모달 문서 변환으로 기업용 RAG 수집 과정을 재설계하다
RAG·검색
cctest.ai
RAG·검색

D-RAC, 멀티모달 문서 변환으로 기업용 RAG 수집 과정을 재설계하다

D-RAC는 PDF, Word, 프레젠테이션, 스프레드시트, 스캔 문서를 PDF로 정규화한 뒤 한 번의 멀티모달 처리로 검색 최적화 Markdown을 생성합니다. 이후 청크 계획은 원문 재생성이 아니라 요소 ID를 기준으로 수행됩니다.

더 보기