아티클 목록으로
AI 안전

LLM 거부 방향 소거 공격을 막는 ‘미끼 방향’ 최적화

약 3분 소요

배경

오픈 웨이트 대규모 언어 모델은 공격자가 가중치와 내부 활성에 직접 접근할 수 있다. 따라서 학습이 끝난 뒤에도 안전 기능이 수정될 수 있다. Refusal Feature Ablation(RFA)은 이러한 위험을 보여주는 대표적인 공격이다. 공격자는 거부해야 하는 입력과 일반 입력에서 나온 활성의 차이를 비교해, 거부 행동과 연관된 선형 방향을 추정한다. 이후 잔차 스트림에서 해당 방향을 투영해 제거하면 일반 능력을 상당 부분 유지하면서 안전 거부 기능만 약화할 수 있다.

카네기멜런대학교 연구진은 이 문제를 겨냥한 사후 가중치 편집 방법으로 Decoy Direction Optimization(DDO)을 제안했다. 모든 체크포인트를 다시 안전 미세조정하는 대신, 공격자가 안전 방향을 추정하는 과정 자체를 교란하는 접근이다.

작동 원리: 진짜 회로가 아니라 측정을 속인다

RFA는 거부와 일반 생성에 해당하는 신호를 구분하는 대조 추정기에 의존한다. DDO는 이 추정 단계에 개입하기 위해 MLP 뉴런에 높은 크기의 비선형 미끼 신호를 주입한다.

공격자가 거부 방향을 다시 계산하면 미끼가 추정값을 오염시킨다. 그 결과 실제 안전 회로와 직교하는 무해한 특징을 거부 방향으로 오인하고, 그 특징을 제거할 가능성이 커진다. 즉, 안전 메커니즘을 숨기기보다 공격자의 측정 도구가 잘못된 대상을 선택하도록 만드는 방식이다. 논문은 이 효과를 설명하는 스펙트럼 경계도 제시하지만, 모든 종류의 편집 공격을 차단한다는 보장은 아니다.

보고된 실험 결과

  • 6개 모델 계열을 평가했으며, 표준 RFA 설정에서 공격 성공률 10% 미만을 기록했다.
  • Llama-3-8B-Instruct의 적응형 다단계 공격에서 최악의 공격 성공률은 65%였다. 비교된 학습 기반 방어는 58%로, DDO가 경쟁력을 보이지만 적응 공격에서는 차이가 남는다는 점을 보여준다.
  • Heretic 가중치 수준 공격의 성공률은 88.7%에서 18%로 낮아졌다.
  • 구성별 최적화 비용은 비교한 학습 기반 기준선보다 30~450배 낮다고 보고됐다.

의미와 한계

DDO의 핵심 의미는 안전 표현을 더 깊이 숨기는 대신, 공격자가 이를 측정하는 방법을 방해한다는 발상의 전환에 있다. 여러 오픈 모델 체크포인트를 관리하는 팀이라면 모델마다 안전 미세조정을 반복하지 않고 사후 처리를 적용할 수 있다는 점이 실용적이다.

그러나 DDO를 완전한 면역책으로 볼 수는 없다. 적응형 공격에서는 비교 방어와의 차이가 남았고, 주입된 미끼가 모델의 능력, 안전 응답, 해석 가능성에 미치는 영향도 별도로 검증해야 한다. 공격자가 미끼 구조를 파악하거나 더 풍부한 내부 신호와 다른 편집 경로를 사용할 가능성도 있다. 따라서 DDO는 훈련, 평가, 모니터링을 대체하기보다 오픈 웨이트 모델 방어 체계에 추가하는 한 계층으로 이해하는 편이 적절하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Google DeepMind, AGI 논의를 넓히는 새 연구기관 출범
AI 안전
cctest.ai
AI 안전

Google DeepMind, AGI 논의를 넓히는 새 연구기관 출범

DeepMind Institute는 범용인공지능을 둘러싼 단일한 입장보다 Google, Google DeepMind, 글로벌 연구계 사이의 견해 차이를 드러내는 것을 목표로 한다. 첫 논문 모음은 모델 투명성, 프런티어 모델 평가, 경제적 충격과 인간의 번영을 다룬다.

더 보기
CCTest · Blog
AI 워터마크가 LLM의 안전 경계를 바꿀 수 있다
AI 안전
cctest.ai
AI 안전

AI 워터마크가 LLM의 안전 경계를 바꿀 수 있다

SynthID-Text를 분석한 연구에서 AI 워터마크가 생성물의 출처 표시뿐 아니라 모델의 거부 응답과 도구 사용에도 영향을 줄 수 있다는 결과가 나왔다. 적대적 프롬프트에서는 일부 모델이 평소 거부하던 유해 요청을 따를 가능성이 높아졌다.

더 보기