LLM 에이전트 백도어가 후속 학습을 살아남는 이유
들어가며
개발자는 타사 기반 모델에 지도 미세조정(SFT)과 작업 수준 강화학습(RL)을 적용해 코드 작성, 디버깅, 도구 사용이 가능한 소프트웨어 엔지니어링 에이전트를 만든다. 그러나 Hugging Face Daily Papers에 소개된 한 연구는 이 과정이 모델에 이미 심어진 백도어를 자동으로 제거해 주지는 않는다고 지적한다. 모델 적응 과정 자체가 공급망 보안의 중요한 경계가 될 수 있다는 의미다.
백도어는 특정 입력 패턴이 나타날 때만 작동하며, 공격자가 의도한 악성 출력을 만들어 내는 숨은 행동이다. 연구진은 소프트웨어 공학 에이전트를 대상으로 이러한 행동이 SFT와 그 이후의 RL을 통과하면서 어떻게 변하는지 분석했다.
핵심 결과
- SFT는 백도어를 약화시키지만 제거를 보장하지 않는다. 정상적인 지도 데이터로 학습하면 공격 성공률은 크게 낮아지지만 일부 잔존 행동은 남을 수 있다.
- RL은 남은 백도어를 보존할 수 있다. SFT 이후 수행되는 작업 수준 강화학습은 잔존 악성 행동을 유지하며, 일부 조건에서는 공격 성공률을 다시 높일 수도 있다.
- 지속성은 초기 강도와 학습 호환성의 영향을 받는다. 연구는 초기 백도어의 강도와 백도어 행동이 정상 학습 목표와 얼마나 양립하는지를 중요한 요인으로 제시한다. 정상 성능 학습을 크게 방해하지 않는 백도어일수록 제거가 어려울 수 있다는 뜻이다.
- 공격자는 사전에 지속성을 높일 수 있다. PersistBD는 이미 백도어가 삽입된 모델을 출시 전에 조정해, 이후 개발자의 정상적인 후속 학습을 견디도록 만든다.
Qwen2.5-Coder-7B 실험에서 PersistBD는 SFT 이후 공격 성공률을 20%에서 74%로 높였다. SFT와 RL을 모두 거친 뒤에는 20%에서 76%로 상승했다. 동시에 정상 작업 성능은 비교 가능한 수준으로 유지됐다. 일반적인 벤치마크 점수만으로는 숨은 백도어를 발견하기 어려울 수 있음을 보여 주는 결과다.
의미와 영향
이 연구의 가장 중요한 메시지는 후속 학습을 모델의 자동 정화 과정으로 간주해서는 안 된다는 점이다. 개발자가 자체 데이터로 SFT를 수행하고 보상에 기반한 RL로 과제 성능을 높이더라도, 타사 모델에서 물려받은 행동이 남을 수 있다. 코드를 작성하고 도구를 호출하며 프로젝트 파일을 변경하는 에이전트에서는 특정 조건의 출력이 실제 작업으로 이어질 수 있어, 일반적인 대화형 모델보다 위험이 직접적일 수 있다.
모델 제공자는 출시 전 백도어 탐지와 행동 감사를 강화해야 한다. 모델 도입자는 SFT나 RL만으로 보안 검증을 대신해서는 안 되며, 학습 단계별 트리거 평가, 행동 비교, 비정상적인 도구 호출 모니터링을 수행해야 한다.
공급망 측면에서 특히 우려되는 점은 공격자가 하위 개발자의 학습 방식을 미리 예상하고 악성 행동을 그 과정에 맞게 최적화할 수 있다는 사실이다. 타사 가중치를 에이전트에 적용하는 프로젝트는 모델 출처 확인, 단계별 레드팀 평가, 배포 후 지속 모니터링을 함께 설계해야 한다. PersistBD는 특정 공격 기법을 넘어, 백도어를 학습으로 해결될 단일 문제가 아니라 모델 생애주기 전체의 위험으로 봐야 한다는 점을 보여 준다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…