딥페이크 탐지가 무너질 때, 이미지 재구성 가능성으로 진위를 인증한다
서론
생성형 모델은 실제 사진과 구분하기 어려운 이미지를 만들고 있습니다. 그만큼 이미지의 내용만 보고 진위를 판정하는 일도 어려워졌습니다. 모하메드 빈 자이드 인공지능대학교 연구진은 최근 4년 동안 공개된 생성기 10종에 대해 딥페이크 탐지기 20종을 평가하며, 기존 탐지 방식이 왜 빠르게 약해지는지 분석했습니다.
기존 탐지기의 취약점
평가 결과 탐지기 정확도는 거의 99.5%에서 76%로 낮아졌습니다. 적대적 섭동을 적용하자 모든 기준 탐지기의 정확도가 2% 미만으로 떨어졌습니다. 이미지에 작은 변형을 가하는 것만으로도 탐지기의 판단을 크게 흔들 수 있으며, 일부 조건에서는 기존 라벨과 사실상 반대되는 결과를 유도할 수 있다는 의미입니다.
이 현상은 많은 탐지기가 ‘합성 콘텐츠’의 보편적인 특징보다 특정 세대 생성기가 남기는 통계적 흔적을 학습하기 때문일 수 있습니다. 생성기의 구조나 샘플링 방식이 바뀌면 이런 흔적은 사라집니다. 공격자는 탐지기가 여전히 의존하는 약점을 찾아 추가로 악용할 수도 있습니다.
더 근본적인 문제도 있습니다. 생성기는 학습 데이터에 포함된 실제 이미지를 기억하고 다시 출력할 수 있습니다. 따라서 같은 이미지가 실제 카메라 촬영 결과일 수도 있고 생성기의 출력일 수도 있습니다. 이미지 자체만으로는 고유한 출처를 확정하기 어렵습니다.
진위 대신 재구성 가능성을 검증
연구진은 ‘보정된 재합성’이라는 접근법을 제시합니다. 시스템이 이미지에 무조건 진짜 또는 가짜라는 라벨을 부여하는 대신, 알려진 생성기가 해당 이미지를 충실하게 재구성할 수 있는지를 확인합니다.
- 어떤 생성기라도 입력 이미지를 충실히 재구성하면 합성 출처의 가능성이 남으므로 인증하지 않습니다.
- 알려진 생성기 가운데 어느 것도 충실한 재구성을 하지 못하면, 평가 범위 안에서 이미지를 인증할 수 있습니다.
- 보정 절차로 기준값을 정해 생성 이미지를 진짜로 잘못 인증하는 비율을 사전에 정한 수준으로 제한합니다.
보고된 실험에서는 생성 이미지의 오인증 비율을 최대 1%로 제한할 수 있었습니다. 평가에 포함된 제한된 범위의 적응형 공격에 대해서는 공격을 고려한 보정을 적용해 같은 한계를 유지했습니다. 다만 임의의 변환이나 미래의 모든 공격까지 방어한다는 뜻은 아닙니다.
의미와 한계
이 접근법의 핵심은 진위 판정을 절대적인 분류 문제가 아니라 위험이 제한된 인증 문제로 바꾼다는 데 있습니다. 인증 결과는 이미지가 반드시 카메라에서 나왔거나 위조 불가능한 출처 기록을 가졌다는 증명이 아닙니다. 현재 평가한 생성기와 보정 조건에서 충실한 재구성이 확인되지 않았다는 뜻에 가깝습니다.
연구는 생성기가 좋아질수록 사후 검증의 공간이 줄어든다는 점도 보여줍니다. Reddit 이미지 3,000장을 대상으로 했을 때 2022년 생성기가 재구성하지 못한 이미지는 1,116장이었습니다. 반면 2024년 생성기에서는 재구성에 실패한 이미지가 55~79장으로 줄었습니다. 생성기가 실제 이미지가 차지하는 시각적 공간을 더 넓게 덮을수록, 콘텐츠만으로 인증할 수 있는 이미지도 감소합니다.
뉴스룸, 플랫폼, 수사기관은 단일 탐지기의 결과를 최종 증거로 사용하기보다 생성기 범위, 보정 데이터, 공격 모델, 원본 생성 시점의 출처 기록을 함께 관리해야 합니다. 콘텐츠 기반 인증은 여전히 유용할 수 있지만, 그 결론은 평가된 모델과 위협 범위 안에서만 해석되어야 합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…