SecOPD, 토큰 단위 증류로 적응형 프롬프트 인젝션 완화
외부 데이터에 숨은 공격 지시
AI 에이전트가 웹사이트, 파일, 이메일을 읽고 작업을 수행할 때 외부 데이터는 단순한 참고 자료가 아닐 수 있습니다. 공격자는 정상적인 문서 안에 원래 지시를 무시하고 자신이 원하는 작업을 수행하라는 문장을 삽입할 수 있습니다. 에이전트가 이 내용을 명령으로 받아들이면 정보 탈취나 의도하지 않은 도구 사용으로 이어질 가능성이 있습니다. 악성 지시가 정상 데이터와 섞여 있기 때문에 키워드 차단만으로 모든 변형을 막기는 어렵습니다.
기존 방어 학습의 한계
보안 모델을 학습할 때 DPO나 GRPO 같은 선호·정책 최적화 기법이 활용됩니다. 그러나 이들 방식은 흔히 전체 응답 단위로 피드백을 제공합니다. 응답 대부분이 안전하더라도 일부에 위험한 행동이 포함되면 전체가 동일하게 처리될 수 있고, 모델은 어떤 토큰과 국소적 선택이 실패를 유발했는지 명확히 알기 어렵습니다.
논문은 이러한 거친 신호가 적응형 프롬프트 인젝션에 대한 취약성을 키운다고 설명합니다. 공격자가 표현을 계속 바꾸면 모델은 일반적인 거부 문구를 학습했더라도, 주입된 지시가 실제 행동을 바꾸는 구체적인 생성 경로까지 억제하지 못할 수 있습니다.
SecOPD의 작동 방식
Secure On-Policy Distillation, 즉 SecOPD는 학습 신호를 토큰 수준으로 세분화합니다.
- 모델에 주입이 포함된 샘플을 입력하고 실제 rollout을 생성합니다.
- 대응하는 정상 입력을 받은 초기화 모델이 rollout의 각 토큰을 평가합니다.
- 이렇게 얻은 토큰별 점수를 방어적 미세조정에 활용합니다.
- 공격 문맥에서 모델이 직접 생성한 rollout을 사용하므로, 정적인 예시뿐 아니라 공격 상황에서 나타날 수 있는 행동도 학습 대상으로 삼습니다.
핵심은 전체 답변에 단순히 “위험”이라는 라벨을 붙이는 대신, 주입과 연관된 국소적 결정과 출력을 찾아 억제하거나 조정하려는 데 있습니다.
논문이 보고한 성능
논문에 따르면 SecOPD로 방어 학습한 Qwen3.6-27B는 PISmith의 최신 적응형 프롬프트 인젝션에 대해 9.0%의 공격 성공률을 기록했습니다. 비교 대상으로 제시된 기존 최선의 방법 Meta-SecAlign은 94.0%였습니다. 학습 과정에서 완전히 보지 못한 에이전트 도구 호출 영역에서는 SecOPD가 4.7%, Meta-SecAlign이 5.5%의 공격 성공률을 보였습니다.
이 수치는 세밀한 학습 신호가 단순히 거부 응답을 암기하는 것 이상으로, 보지 못한 실행 영역에 대한 일반화에도 도움을 줄 가능성을 보여줍니다. 특히 도구 호출 에이전트에서는 모델 출력이 외부 행동으로 이어질 수 있어, 텍스트 응답의 오류보다 주입 성공의 영향이 커질 수 있습니다.
의미와 한계
SecOPD의 중요한 관점은 프롬프트 인젝션 방어를 신용 할당 문제로 다룬다는 점입니다. 어떤 부분의 생성 결정이 공격을 통과시켰는지 모델이 학습할 수 있다면 방어 미세조정을 더 정밀하게 설계할 수 있습니다.
다만 보고된 수치는 특정 모델과 벤치마크, 공격 설정에서 얻은 결과입니다. 모든 실제 에이전트 환경의 안전성을 보장하는 것은 아닙니다. 공격자의 능력, 도구 권한, 컨텍스트 구성, 공격 성공률의 정의에 따라 결과는 달라질 수 있습니다. 실제 배포에서는 최소 권한 원칙, 도구 실행 전 확인, 외부 데이터와 명령의 분리, 런타임 모니터링을 함께 적용해야 합니다. 코드와 모델이 공개된 만큼, 다양한 환경에서의 재현과 추가 검증이 다음 과제입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…