아티클 목록으로
AI 안전

LLM 백도어 공격, 독성 데이터의 개수보다 선택이 중요하다

약 3분 소요

들어가며

대규모 언어 모델의 백도어 위험을 평가할 때는 보통 독성 샘플의 개수를 고정한 뒤 후보 풀에서 무작위로 샘플을 뽑아 미세조정한다. 조건을 통제하기 쉬운 방식이지만, 샘플 간 조합 효과와 개별 샘플의 영향력 차이를 놓칠 수 있다. 「Pick Your Poison」 연구는 이런 무작위 선택이 모델의 최악 상황 취약성을 크게 낮춰 보이게 만들 수 있다고 지적한다.

핵심 내용

  • 독성 샘플의 개수만으로는 부족하다. 세 가지 LLaMA-3-8B 백도어 설정에서 모델, 정상 학습 데이터, 독성 샘플 수를 모두 고정했지만, 샘플 묶음만 바꾸자 공격 성공률이 3%에서 80%까지 달라졌다. 따라서 독성 데이터의 양과 구성을 별도로 분석해야 한다.
  • 문제를 집합 선택으로 재정의했다. 연구진은 제한된 평가 예산 안에서 가장 효과적인 독성 샘플 집합을 찾는 문제로 이를 정식화했다. 모든 후보 집합을 직접 미세조정하고 평가하는 방식은 계산 비용이 지나치게 크다.
  • SAILS는 학습과 감사를 결합한다. SAILS(Set-level Audit-Informed Iterative Learned Selection)는 먼저 수백 번의 미세조정 및 평가를 수행해 전체 독성 집합을 평가하는 점수 모델을 학습한다. 그다음 수백만 개 후보의 순위를 계산하고, 상위 일부만 직접 감사한다.
  • 다양한 백도어 설정을 다룬다. 제공된 자료에 따르면 SAILS는 강력한 영향력 기반 기준선보다 보류 데이터에서 평균 30%포인트 높은 공격 성공률을 기록했다. 소규모 미세조정에서 전체 규모 미세조정으로 전이되며, 코드 생성, 에이전트, API 전용 백도어에도 확장됐다.

의미와 영향

이 연구의 핵심은 단순히 더 많은 데이터를 오염시키는 공격법에 있지 않다. 안전성 평가가 평균적인 공격 결과를 측정하는지, 아니면 정교하게 선택된 공격에 대한 최악의 위험을 측정하는지를 다시 묻는 데 있다. 무작위 독성 집합만 사용하면 낮은 공격 성공률이 실제 모델의 견고함이 아니라, 우연히 영향력이 작은 후보를 골랐기 때문일 수 있다.

모델 개발자는 백도어 평가에 집합 수준의 탐색, 반복 실험, 학습 규모를 넘나드는 재현성 검사를 포함해야 한다. 방어 측면에서도 개별 데이터가 이상한지 여부만 볼 것이 아니라, 동일한 트리거 또는 목표 행동을 공유하는 샘플들이 결합될 때 생기는 효과를 살펴봐야 한다. 데이터 감사의 단위가 행 하나에서 조합으로 넓어져야 한다는 뜻이다.

SAILS는 전수 탐색과 단순 무작위 샘플링 사이의 실용적인 절충안으로 볼 수 있다. 비용이 큰 학습·평가를 제한적으로 수행해 유망한 후보 영역을 학습하고, 이후 감사 자원을 상위 후보에 집중하기 때문이다. 다만 다른 모델 구조, 학습 파이프라인, 방어 기법에서도 결과가 안정적으로 유지되는지는 제공된 자료만으로 확인할 수 없다. 더 폭넓은 독립 검증이 필요하다.

Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Anthropic·OpenAI의 AI 안전 평가자 상주안, 독립성은 지켜질까
AI 안전
cctest.ai
AI 안전

Anthropic·OpenAI의 AI 안전 평가자 상주안, 독립성은 지켜질까

Anthropic과 OpenAI가 외부 안전 평가자를 최전선 AI 연구소 내부에 배치하는 방안을 지지하고 있다. 훈련 과정까지 들여다볼 수 있다는 점은 진전이지만, 접근 권한과 결과 공개의 자유가 보장되지 않으면 독립 감시는 유명무실해질 수 있다.

더 보기
CCTest · Blog
AI가 운영하는 ‘연애’: 자동화된 데이팅 앱 사기의 실체
AI 안전
cctest.ai
AI 안전

AI가 운영하는 ‘연애’: 자동화된 데이팅 앱 사기의 실체

일부 데이팅 앱이 AI로 만든 인물, 조작된 활동 기록, 유급 작업자를 결합해 이용자를 유료 대화로 유도한 정황이 드러났습니다. 이용자가 돈을 내고 대화한 상대 대부분이 실제 사람이 아니라 AI였을 가능성이 있습니다.

더 보기