아티클 목록으로
AI 안전

Hugging Face, 이미지 편집 모델 악용 방지 부족 논란

약 3분 소요

도입

오픈 AI 플랫폼은 모델 공유와 실험, 재사용을 촉진하는 핵심 인프라가 됐다. 하지만 강력한 이미지 편집 모델이 비동의 친밀 이미지 딥페이크 제작에 쓰일 수 있다면, 문제는 개별 개발자의 책임을 넘어 플랫폼의 기본 안전 설계로 확장된다.

The Verge 보도에 따르면, 유럽 비영리 단체 AI Forensics는 Hugging Face가 자사 플랫폼에 호스팅된 이미지 편집 모델의 성적 딥페이크 악용을 막는 데 충분한 조치를 취하지 않고 있다는 보고서를 발표했다.

핵심 내용

  • 인기 모델이 유해 요청에 응답: AI Forensics는 Hugging Face의 주요 이미지 편집 모델을 테스트했으며, 상위 9개 모델 중 7개가 여성 이미지를 상반신 노출 상태로 바꾸는 단순 요청에 응답했다고 밝혔다.
  • 복잡한 우회 기법이 아니었다: 연구진은 정교한 프롬프트 우회나 은유적 표현을 사용하지 않고, 모든 테스트에 같은 직접적인 요청을 사용했다고 설명했다. 이는 문제가 특정 ‘탈옥’ 기법이 아니라 기본적인 방어 장치의 부재에 가깝다는 점을 시사한다.
  • 허니팟 Spaces에서 실제 수요 확인: AI Forensics는 실제 이미지를 생성하지 않는 이미지 편집용 Spaces를 만들어 들어오는 프롬프트와 이미지를 관찰했다. 7일 동안 1,000건이 넘는 프롬프트와 이미지가 접수됐고, 이 중 73%가 성적 성격을 띠었다고 한다. 성적 요청 중 83%는 이미지 속 인물을 ‘탈의’시키려 했고, 95%는 여성을 대상으로 했으며, 거의 7%는 아동을 겨냥한 요청이었다.
  • 정책과 집행의 간극: Hugging Face의 정책은 명시적 동의 없이 만들어진 성적 콘텐츠와 미성년자 노출 콘텐츠를 금지한다. 그러나 AI Forensics는 플랫폼 차원의 입력 필터링과 출력 스캔이 충분히 구현되지 않았고, 많은 보호 조치가 개별 개발자에게 맡겨져 있다고 지적한다.

의미와 영향

이번 사례는 오픈 AI 생태계의 오래된 긴장을 다시 드러낸다. 낮은 진입 장벽은 혁신을 촉진하지만, 동시에 악용의 비용도 낮춘다. 특히 비동의 친밀 이미지는 생성과 유포만으로 피해자에게 심각한 피해를 남기며, 사후 조치만으로 회복하기 어렵다.

AI Forensics는 이미지와 영상을 생성하는 Spaces에 대해 프롬프트 단계의 필터링과 출력 단계의 스캔을 도입할 것을 권고했다. 이런 조치가 모든 악용을 막지는 못하더라도, 플랫폼 전반에 최소한의 안전 기준을 세우고 악용 비용을 높이는 역할은 할 수 있다.

Hugging Face 같은 핵심 플랫폼에 이번 논란은 단순한 운영 이슈가 아니다. 모델을 쉽게 배포하고 실행할 수 있게 하는 인프라라면, 금지 정책을 문서에 적는 것만으로는 부족하다. 안전장치는 선택 사항이 아니라 기본값으로 제품에 내장되어야 한다.

출처: The Verge AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AI가 버그를 찾는 속도, 패치 속도를 앞지르다: Microsoft와 Anthropic의 사례
AI 안전
cctest.ai
AI 안전

AI가 버그를 찾는 속도, 패치 속도를 앞지르다: Microsoft와 Anthropic의 사례

Anthropic의 Mythos 모델은 Microsoft 제품의 취약점을 빠르게 찾아내며 보안 대응 방식을 흔들고 있다. AI가 방어 도구가 되는 동시에 공격자에게도 같은 속도를 제공할 수 있다는 점이 핵심이다.

더 보기