아티클 목록으로
AI 안전

인기 있는 사실일수록 잊기 어렵다: LLM 언러닝을 바꾸는 AdaPop

약 3분 소요

배경

대규모 언어 모델에서 특정 지식을 지우는 일은 단순히 해당 데이터에 반대 방향의 그래디언트를 적용하는 문제와 다릅니다. 사전학습 코퍼스에 반복적으로 등장한 사실은 드문 사실보다 모델 내부에 더 깊게 새겨질 수 있습니다. 따라서 모든 망각 대상에 동일한 압력을 가하면 희귀한 지식은 사라져도, 인기 있는 사실은 표현을 바꾼 질문을 통해 다시 드러날 가능성이 있습니다. AdaPop은 이런 차이를 언러닝 과정에 반영하려는 방법입니다.

핵심 설계

AdaPop은 사실마다 기억되는 정도와 삭제 난도가 다르다는 전제에서 출발합니다.

  • 인기도 기반 조정: 각 사실에 인기도에 따라 달라지는 지수를 부여합니다. 신호는 Wikidata 사이트 링크 수 같은 외부 프록시나 LLM-as-Judge 방식으로 얻을 수 있습니다.
  • 토큰 수준 확신도 결합: 사실 전체의 인기도뿐 아니라 모델이 특정 토큰을 얼마나 확신하는지도 살핍니다. 이를 통해 샘플 단위의 획일적인 가중치보다 실제 출력에 가까운 업데이트를 시도합니다.
  • 보존 제약의 자동 제어: 망각을 과도하게 밀어붙이면 관련 없는 능력까지 손상될 수 있습니다. AdaPop은 dual-ascent 제어기를 사용해 매 에포크 보존 패널티를 조정하고, 삭제와 보존 사이의 균형을 찾습니다.

실험에서 보고된 내용

논문 초록에 따르면 AdaPop은 세 가지 모델 계열과 두 개의 벤치마크에서 평가됐습니다. 패러프레이즈 질의에서는 경쟁 방법보다 잊힌 콘텐츠의 누출이 약 5분의 1로 줄었고, 적대적 재구성에서는 약 1.6배 낮아졌습니다. 이 수치는 논문이 사용한 실험 조건에 해당하며, 모든 모델과 데이터셋에 대한 보편적인 보장으로 해석해서는 안 됩니다.

내부 표현 분석에서도 차이가 관찰됐습니다. AdaPop을 적용한 망각 집합의 은닉 상태는 언러닝 이전 모델의 상태에서 다른 방법보다 더 멀리 이동했습니다. 반면 보존 집합의 표현은 원래 상태에 가깝게 유지됐습니다. 즉 모델 전체를 크게 흔들기보다 삭제해야 할 지식에 변화를 집중하려는 설계로 볼 수 있습니다.

의미와 한계

AdaPop의 주요 시사점은 지식 삭제에 동일한 자원을 배분하지 말고, 모델에 얼마나 깊이 기억됐는지에 따라 조정해야 한다는 것입니다. 이 접근은 개인정보 삭제, 데이터 거버넌스, 모델 유지보수와 같은 영역에서 활용 가능성을 제시합니다.

다만 인기도는 기억 강도를 직접 측정하는 값이 아니라 대리 지표입니다. 외부 데이터와 LLM 기반 평가에는 각각 편향이 들어갈 수 있습니다. 따라서 후속 검증에서는 직접 질의뿐 아니라 패러프레이즈, 적대적 프롬프트, 모델 규모별 차이, 보존 능력의 변화까지 함께 측정해야 합니다. AdaPop이 언러닝 문제를 해결한 것은 아니지만, 더 세밀하고 피드백을 활용하는 방향을 보여준다는 점에서 의미가 있습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Claude의 인터넷 접근이 드러낸 AI 평가 환경의 맹점
AI 안전
cctest.ai
AI 안전

Claude의 인터넷 접근이 드러낸 AI 평가 환경의 맹점

Anthropic은 과거 141006회의 평가 실행을 감사한 결과, 격리된 것으로 알려진 환경에서 모델이 공용 인터넷에 접근한 세 가지 사건을 확인했다. 핵심 원인은 단일 모델의 통제 실패보다 이그레스 제어와 모니터링, 평가 환경 설계의 결함이었다.

더 보기