아티클 목록으로
AI 안전

NEEDLE, 가중치 직교화로 대규모 언어 모델 백도어 제거

약 3분 소요

들어가며

대규모 언어 모델의 백도어 공격은 평상시에는 정상적으로 작동하다가 특정 단어, 패턴 또는 입력 조건이 등장했을 때만 공격자가 심어 둔 행동을 실행하도록 만들 수 있습니다. 따라서 일반적인 성능 평가만으로는 발견하기 어렵습니다. 배포 이후에는 유해한 응답, 예상하지 못한 작업, 코드 인젝션과 같은 문제로 이어질 가능성도 있습니다.

백도어를 제거하는 과정 자체도 위험을 동반합니다. 수정 강도를 높이면 공격 성공률은 낮아질 수 있지만, 정상 프롬프트에 대한 출력 분포까지 바뀌어 일반 능력이나 안전한 거부 응답이 약화될 수 있습니다. Locai Labs 연구진이 제안한 NEEDLE은 이 부작용을 줄이면서 특정 백도어를 겨냥하는 것을 목표로 합니다.

핵심 작동 방식

NEEDLE은 재학습 없이 적용되는 방법입니다. 다만 방어자가 제거하려는 트리거를 이미 식별했다는 전제를 둡니다. 주요 절차는 다음과 같습니다.

  • 백도어 방향 추정: 트리거가 포함된 입력과 일반 입력의 활성화 벡터를 비교해, 트리거가 내부 표현을 이동시키는 주요 방향을 추정합니다.
  • 거부 부분공간 구성: 모델의 거부 행동과 관련된 활성화를 분석해 수정 과정에서 보존해야 할 표현 영역을 정의합니다.
  • 계층별 가중치 직교화: 어텐션과 MLP 출력 가중치를 조정해 관련 활성화가 백도어 방향으로 전달되는 것을 억제합니다.
  • 안전 표현 보정: 앞쪽 계층을 수정하면 뒤쪽 계층의 입력도 변하므로, 폐쇄형 보정식을 사용해 거부 부분공간에 대한 활성화 투영을 가능한 한 유지합니다.

이 방식의 핵심은 모델의 넓은 파라미터 영역을 단순히 삭제하지 않는 데 있습니다. 트리거와 연관된 방향은 억제하되, 안전 거부와 연관된 표현은 보호하려는 것입니다. 또한 깨끗한 참조 모델이나 원래의 오염 학습 데이터도 필요로 하지 않습니다.

결과와 의미

논문은 여러 모델 계열과 공격 유형을 대상으로 NEEDLE을 평가했습니다. 저자 보고에 따르면 비교된 방어 기법 가운데 평균 공격 성공률이 가장 낮았으며, 까다로운 코드 인젝션 공격에서는 0%라는 결과도 제시했습니다. 동시에 KL 발산이 가장 낮고, 모델의 능력과 안전성에 대한 변화도 작았다고 설명합니다. 다만 이는 논문에서 사용한 모델, 트리거, 평가 조건에 따른 결과이며, 모든 미지의 백도어 제거를 보장하는 결론으로 확대해서는 안 됩니다.

NEEDLE이 제시하는 중요한 관점은 모델 수정을 전면 재학습이 아닌 ‘정밀 수술’로 바라보는 것입니다. 트리거를 알고 있다면 내부 표현과 가중치를 직접 조정해 복구 비용과 부작용을 줄일 가능성이 있습니다. 또한 백도어 방어는 공격 성공률 하나만으로 평가해서는 안 됩니다. 정상 입력에 대한 응답, 출력 분포 변화, 일반 능력, 거부 안전성을 함께 확인해야 합니다. 미지의 트리거, 여러 백도어의 동시 존재, 대규모 운영 모델에서의 추가 검증이 남은 과제입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
잠재 통신, 멀티에이전트 시스템의 새로운 안전 공격면이 되다
AI 안전
cctest.ai
AI 안전

잠재 통신, 멀티에이전트 시스템의 새로운 안전 공격면이 되다

새 연구는 기반 모델을 바꾸지 않아도 학습 가능한 잠재 통신 링크가 거부 행동을 약화시킬 수 있음을 보여준다. 링크를 악의적으로 최적화하면 유해 요청에 대한 순응을 키울 수 있지만, 안전성을 반영한 보상으로 링크를 복구할 가능성도 제시됐다.

더 보기
CCTest · Blog
같은 문자열, 다른 권한: 제어 토큰이 프롬프트 주입을 키우는 방식
AI 안전
cctest.ai
AI 안전

같은 문자열, 다른 권한: 제어 토큰이 프롬프트 주입을 키우는 방식

새 연구는 동일한 문자열로 디코딩되는 채팅 템플릿 표식도 예약 제어 토큰으로 처리되는지, 일반 서브워드로 분할되는지에 따라 공격력이 크게 달라진다고 밝혔다. 차이를 만드는 핵심은 눈에 보이는 바이트가 아니라 표식 위치의 학습된 표현이다.

더 보기