아티클 목록으로
AI 안전

Abliteration.ai, AI 안전장치 제거를 서비스로 만든다

약 4분 소요

들어가며

대부분의 상용 AI 서비스에는 위험한 요청을 거부하는 안전장치가 기본으로 들어간다. 하지만 오픈 웨이트 모델 생태계에서는 모델의 거부 성향을 약화하거나 제거하는 작업이 오래전부터 이뤄져 왔다. Abliteration.ai는 이 기술을 개발자가 직접 적용하는 관행에서 끌어내, 브라우저와 API로 바로 사용할 수 있는 상업 서비스로 만들고 있다.

핵심 내용

  • 모델 수정 기술을 호스팅 서비스로 전환했다. 회사는 Z.ai의 GLM-5.3을 포함해 안전 거부 기능이 제거된 오픈 웨이트 모델을 제공한다.
  • 공식 명분은 방어 목적의 테스트다. 회사는 기존 모델이 공격 코드를 거부하면 레드팀이 실제 공격자의 행동을 재현하기 어렵다고 주장한다. 주요 용도는 공격적 사이버 테스트, 레드팀, AI 에이전트 평가다.
  • 위험한 출력에 접근하는 장벽도 낮아진다. TechCrunch의 테스트에서 모델은 일반적으로 안전장치가 차단할 만한 고위험 요청에도 응답했다. 일부 제한은 남아 있고 고객이 별도 모더레이션 계층을 추가할 수 있지만, 플랫폼 자체의 통제 수준은 아직 발전 중이다.
  • 고객 선별과 책임 범위가 불분명하다. 현재 회사가 시행하는 확인 절차는 결제 카드 기록 수준이며, 누가 이런 능력에 접근해야 하는지에 대한 기준도 확정되지 않았다.

방어 도구인가, 위험 확산 장치인가

Abliteration.ai의 논리는 사이버 보안 업계에서 낯설지 않다. 공격자는 상용 모델의 거부 정책에 묶이지 않으므로, 방어팀도 공격 행동을 재현할 수 있는 도구를 가져야 한다는 것이다. 은행, 항공사, 핵심 인프라 기업의 AI 에이전트를 점검하는 레드팀에는 제한이 적은 모델이 현실적인 시험 환경을 제공할 수 있다. 공격자가 이미 자체적으로 모델을 수정하고 있다면 연구자에게도 유사한 도구가 필요하다는 주장도 나온다.

그러나 방어자에게 같은 도구를 제공한다고 해서 자동으로 안전이 높아지는 것은 아니다. 정당한 보안 검증에는 사전 승인, 격리 환경, 작업 기록, 출력 통제가 필요하다. 계정 생성 후 곧바로 대화할 수 있는 서비스에서는 이런 절차가 선택적 기능으로 밀릴 수 있다. 비판자들은 이 같은 접근성이 사이버 공격이나 생물안전 관련 위험 정보의 생성을 쉽게 만들고, 악용 확산 속도가 플랫폼의 감시 역량을 넘어설 수 있다고 우려한다.

기술적 한계도 있다. 일부 레드팀 업체는 애초에 안전 제한이 적은 오픈 모델을 파인튜닝하는 방식을 선호하며, 거부 기능을 제거하면 모델의 지식이나 성능 일부가 손상될 수 있다고 말한다. 반면 전체 성능이 낮아지더라도 시스템 스트레스 테스트에 필요한 특정 행동을 끌어내는 데는 유용할 수 있다는 견해도 있다.

영향: 모델 공개 이후의 거버넌스가 중요하다

이번 사례는 AI 안전을 출시 시점의 학습과 필터에만 맡길 수 없다는 점을 보여준다. 가중치를 내려받을 수 있는 모델은 공개 이후 다시 수정될 수 있기 때문이다. 앞으로는 추론 서비스, 고성능 GPU 임대, 고객 신원 확인, 고위험 요청 탐지까지 함께 다뤄야 한다.

전문가들이 제안하는 대응책에는 위험한 사이버·생물 활동을 탐지하는 분류기, 고성능 컴퓨팅 자원에 대한 강화된 신원 확인, 오용 가능성이 의심되는 고객에 대한 접근 제한이 포함된다. 기업이 승인된 레드팀 업무에 수정 모델을 활용할 때도 사용 범위 제한, 샌드박스, 감사 로그가 필요하다. Abliteration.ai는 오픈소스 커뮤니티 안에 머물던 ‘AI 안전장치 제거’ 문제를 상업 서비스의 책임과 공공 규제에 관한 논쟁으로 확장하고 있다.

출처: TechCrunch AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AI 자기개선은 언제 ‘자기증폭’ 상태가 되는가
AI 안전
cctest.ai
AI 안전

AI 자기개선은 언제 ‘자기증폭’ 상태가 되는가

한 이론 연구가 AI가 차세대 AI 연구개발에 참여할 때 개선 효과가 개발 주기를 거치며 커지는지 약해지는지를 판단하는 ‘AI 재귀 재생산 수’ R_AI를 제안했다. 자기증폭으로의 전환은 특정 능력 수준이 아니라 연구 피드백 구조에 달려 있다.

더 보기