간접 프롬프트 인젝션은 왜 테스트 시점 탐색 문제인가
들어가며
간접 프롬프트 인젝션은 흔히 악성 지시문 하나가 에이전트를 속일 수 있는지의 문제로 설명됩니다. 하지만 외부 문서나 웹 콘텐츠를 읽고 도구를 호출하는 에이전트에서는 공격 결과가 문장 하나만으로 결정되지 않습니다. 에이전트가 놓인 환경, 사용자의 작업, 접근 가능한 도구, 공격자가 여러 경로를 시도할 수 있는지가 실제 공격면을 바꿉니다.
arXiv 논문 《Rethinking Indirect Prompt Injection as a Test-Time Search Problem》은 간접 프롬프트 인젝션을 테스트 시점에 공격면을 탐색하는 문제로 다시 정의합니다. 이 공격면은 환경, 사용자 작업, 공격자가 수행하려는 주입 작업에 의해 만들어집니다. 따라서 취약성을 피해 모델에 고정된 속성으로 보기보다, 공격자와 시스템 사이의 상호작용으로 평가해야 한다는 관점입니다.
핵심 내용
- 공격면은 작업에 따라 달라집니다. 어떤 정보원, 도구, 상호작용 경로가 공격에 활용될 수 있는지는 작업 환경에 좌우됩니다. 같은 에이전트라도 수행하는 작업과 주변 환경이 달라지면 실제 위험도 달라질 수 있습니다.
- 공격자는 먼저 환경을 파악해야 합니다. 연구진은 전용 검색 하니스를 갖춘 에이전트형 공격자를 설계했습니다. 이 공격자는 환경을 정찰하고, 공격 전략을 구조화해 검토하며, 피해 에이전트의 반응을 바탕으로 다음 시도를 조정합니다.
- 테스트 시점 연산이 많을수록 발견 능력이 향상됩니다. 서로 다른 작업을 대상으로 한 결과에서 공격자에게 더 많은 테스트 시점 연산을 제공하면 취약점 발견과 악용 성과가 개선됐습니다. 따라서 평가 결과에는 성공 여부뿐 아니라 공격자가 사용한 탐색 예산도 포함되어야 합니다.
- 전략 관리가 중복 탐색을 줄입니다. 절제 실험은 공격 전략을 명시적으로 관리할 때 같은 시도를 반복하는 문제를 줄일 수 있음을 보여줍니다. 더 큰 예산에서 성과를 유지하려면 무작위 시행보다 체계적인 탐색이 중요합니다.
의미와 영향
이 연구의 핵심은 에이전트 보안을 단순히 “취약하다” 또는 “견고하다”로 표시하기 어렵다는 점입니다. 어떤 환경에서 어떤 작업을 대상으로 했는지, 공격자가 어떤 절차와 계산 예산을 사용했는지에 따라 측정되는 공격 성공률이 달라질 수 있습니다.
앞으로의 보안 벤치마크는 피해 에이전트와 방어 방식만 기록해서는 충분하지 않습니다. 환경 조건, 주입 작업, 공격자의 탐색 절차, 테스트 시점 연산도 함께 명시해야 합니다. 그래야 서로 다른 방어 기법을 비교할 때 결과를 더 정확히 해석하고 재현할 수 있습니다.
방어 관점에서는 단일 악성 프롬프트를 찾아내는 방식만으로는 부족하다는 메시지가 나옵니다. 적응형 공격자는 외부 콘텐츠를 관찰하고, 여러 가설을 시험하며, 에이전트의 반응을 다음 공격에 활용할 수 있습니다. 따라서 데이터와 지시문의 경계를 분명히 하고, 불필요한 도구 권한을 줄이며, 피드백에 따라 에이전트의 행동 범위가 점차 넓어지는지 살펴봐야 합니다.
논문 요약은 완성된 대응책을 제시하지 않습니다. 대신 도구를 사용하는 에이전트에게 공격면을 적응적으로 탐색하는 능력 자체가 아직 충분히 다뤄지지 않은 보안 위험이라고 지적합니다. 간접 프롬프트 인젝션은 한 줄의 악성 문구가 아니라, 복잡한 환경에서 공격자와 에이전트가 벌이는 지속적인 탐색 경쟁으로 이해할 필요가 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…