LLM 백도어 공격, 독성 데이터의 개수보다 선택이 중요하다
들어가며
대규모 언어 모델의 백도어 위험을 평가할 때는 보통 독성 샘플의 개수를 고정한 뒤 후보 풀에서 무작위로 샘플을 뽑아 미세조정한다. 조건을 통제하기 쉬운 방식이지만, 샘플 간 조합 효과와 개별 샘플의 영향력 차이를 놓칠 수 있다. 「Pick Your Poison」 연구는 이런 무작위 선택이 모델의 최악 상황 취약성을 크게 낮춰 보이게 만들 수 있다고 지적한다.
핵심 내용
- 독성 샘플의 개수만으로는 부족하다. 세 가지 LLaMA-3-8B 백도어 설정에서 모델, 정상 학습 데이터, 독성 샘플 수를 모두 고정했지만, 샘플 묶음만 바꾸자 공격 성공률이 3%에서 80%까지 달라졌다. 따라서 독성 데이터의 양과 구성을 별도로 분석해야 한다.
- 문제를 집합 선택으로 재정의했다. 연구진은 제한된 평가 예산 안에서 가장 효과적인 독성 샘플 집합을 찾는 문제로 이를 정식화했다. 모든 후보 집합을 직접 미세조정하고 평가하는 방식은 계산 비용이 지나치게 크다.
- SAILS는 학습과 감사를 결합한다. SAILS(Set-level Audit-Informed Iterative Learned Selection)는 먼저 수백 번의 미세조정 및 평가를 수행해 전체 독성 집합을 평가하는 점수 모델을 학습한다. 그다음 수백만 개 후보의 순위를 계산하고, 상위 일부만 직접 감사한다.
- 다양한 백도어 설정을 다룬다. 제공된 자료에 따르면 SAILS는 강력한 영향력 기반 기준선보다 보류 데이터에서 평균 30%포인트 높은 공격 성공률을 기록했다. 소규모 미세조정에서 전체 규모 미세조정으로 전이되며, 코드 생성, 에이전트, API 전용 백도어에도 확장됐다.
의미와 영향
이 연구의 핵심은 단순히 더 많은 데이터를 오염시키는 공격법에 있지 않다. 안전성 평가가 평균적인 공격 결과를 측정하는지, 아니면 정교하게 선택된 공격에 대한 최악의 위험을 측정하는지를 다시 묻는 데 있다. 무작위 독성 집합만 사용하면 낮은 공격 성공률이 실제 모델의 견고함이 아니라, 우연히 영향력이 작은 후보를 골랐기 때문일 수 있다.
모델 개발자는 백도어 평가에 집합 수준의 탐색, 반복 실험, 학습 규모를 넘나드는 재현성 검사를 포함해야 한다. 방어 측면에서도 개별 데이터가 이상한지 여부만 볼 것이 아니라, 동일한 트리거 또는 목표 행동을 공유하는 샘플들이 결합될 때 생기는 효과를 살펴봐야 한다. 데이터 감사의 단위가 행 하나에서 조합으로 넓어져야 한다는 뜻이다.
SAILS는 전수 탐색과 단순 무작위 샘플링 사이의 실용적인 절충안으로 볼 수 있다. 비용이 큰 학습·평가를 제한적으로 수행해 유망한 후보 영역을 학습하고, 이후 감사 자원을 상위 후보에 집중하기 때문이다. 다만 다른 모델 구조, 학습 파이프라인, 방어 기법에서도 결과가 안정적으로 유지되는지는 제공된 자료만으로 확인할 수 없다. 더 폭넓은 독립 검증이 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…