아티클 목록으로
모델 평가

딥페이크 탐지가 무너질 때, 이미지 재구성 가능성으로 진위를 인증한다

약 4분 소요

서론

생성형 모델은 실제 사진과 구분하기 어려운 이미지를 만들고 있습니다. 그만큼 이미지의 내용만 보고 진위를 판정하는 일도 어려워졌습니다. 모하메드 빈 자이드 인공지능대학교 연구진은 최근 4년 동안 공개된 생성기 10종에 대해 딥페이크 탐지기 20종을 평가하며, 기존 탐지 방식이 왜 빠르게 약해지는지 분석했습니다.

기존 탐지기의 취약점

평가 결과 탐지기 정확도는 거의 99.5%에서 76%로 낮아졌습니다. 적대적 섭동을 적용하자 모든 기준 탐지기의 정확도가 2% 미만으로 떨어졌습니다. 이미지에 작은 변형을 가하는 것만으로도 탐지기의 판단을 크게 흔들 수 있으며, 일부 조건에서는 기존 라벨과 사실상 반대되는 결과를 유도할 수 있다는 의미입니다.

이 현상은 많은 탐지기가 ‘합성 콘텐츠’의 보편적인 특징보다 특정 세대 생성기가 남기는 통계적 흔적을 학습하기 때문일 수 있습니다. 생성기의 구조나 샘플링 방식이 바뀌면 이런 흔적은 사라집니다. 공격자는 탐지기가 여전히 의존하는 약점을 찾아 추가로 악용할 수도 있습니다.

더 근본적인 문제도 있습니다. 생성기는 학습 데이터에 포함된 실제 이미지를 기억하고 다시 출력할 수 있습니다. 따라서 같은 이미지가 실제 카메라 촬영 결과일 수도 있고 생성기의 출력일 수도 있습니다. 이미지 자체만으로는 고유한 출처를 확정하기 어렵습니다.

진위 대신 재구성 가능성을 검증

연구진은 ‘보정된 재합성’이라는 접근법을 제시합니다. 시스템이 이미지에 무조건 진짜 또는 가짜라는 라벨을 부여하는 대신, 알려진 생성기가 해당 이미지를 충실하게 재구성할 수 있는지를 확인합니다.

  • 어떤 생성기라도 입력 이미지를 충실히 재구성하면 합성 출처의 가능성이 남으므로 인증하지 않습니다.
  • 알려진 생성기 가운데 어느 것도 충실한 재구성을 하지 못하면, 평가 범위 안에서 이미지를 인증할 수 있습니다.
  • 보정 절차로 기준값을 정해 생성 이미지를 진짜로 잘못 인증하는 비율을 사전에 정한 수준으로 제한합니다.

보고된 실험에서는 생성 이미지의 오인증 비율을 최대 1%로 제한할 수 있었습니다. 평가에 포함된 제한된 범위의 적응형 공격에 대해서는 공격을 고려한 보정을 적용해 같은 한계를 유지했습니다. 다만 임의의 변환이나 미래의 모든 공격까지 방어한다는 뜻은 아닙니다.

의미와 한계

이 접근법의 핵심은 진위 판정을 절대적인 분류 문제가 아니라 위험이 제한된 인증 문제로 바꾼다는 데 있습니다. 인증 결과는 이미지가 반드시 카메라에서 나왔거나 위조 불가능한 출처 기록을 가졌다는 증명이 아닙니다. 현재 평가한 생성기와 보정 조건에서 충실한 재구성이 확인되지 않았다는 뜻에 가깝습니다.

연구는 생성기가 좋아질수록 사후 검증의 공간이 줄어든다는 점도 보여줍니다. Reddit 이미지 3,000장을 대상으로 했을 때 2022년 생성기가 재구성하지 못한 이미지는 1,116장이었습니다. 반면 2024년 생성기에서는 재구성에 실패한 이미지가 55~79장으로 줄었습니다. 생성기가 실제 이미지가 차지하는 시각적 공간을 더 넓게 덮을수록, 콘텐츠만으로 인증할 수 있는 이미지도 감소합니다.

뉴스룸, 플랫폼, 수사기관은 단일 탐지기의 결과를 최종 증거로 사용하기보다 생성기 범위, 보정 데이터, 공격 모델, 원본 생성 시점의 출처 기록을 함께 관리해야 합니다. 콘텐츠 기반 인증은 여전히 유용할 수 있지만, 그 결론은 평가된 모델과 위협 범위 안에서만 해석되어야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
OSWorld-Pro, 컴퓨터 사용 에이전트를 최종 결과 너머에서 평가하다
모델 평가
cctest.ai
모델 평가

OSWorld-Pro, 컴퓨터 사용 에이전트를 최종 결과 너머에서 평가하다

OSWorld-Pro는 컴퓨터 사용 에이전트가 최종 상태에 도달했는지만 보지 않고, 연속적인 하위 목표를 어떻게 수행했는지 평가한다. 클릭 오류와 키보드 입력 실수, 목표와 무관한 행동까지 분석할 수 있다.

더 보기
CCTest · Blog
의료 오픈엔드 답변에서 검색 기반 사실 검증이 무너지는 이유
모델 평가
cctest.ai
모델 평가

의료 오픈엔드 답변에서 검색 기반 사실 검증이 무너지는 이유

장문 의료 답변의 사실성을 분석한 연구는 검색 후 검증하는 시스템이 폐쇄형 벤치마크에서는 높은 점수를 받아도 임상 오픈엔드 답변에서는 크게 실패할 수 있음을 보여준다. 연구진은 문제를 검색된 증거의 품질과 검증 모델의 추론 오류로 나눠 분석했다.

더 보기
CCTest · Blog
HyperBrowseComp, 다국어·멀티모달 웹 브라우징 에이전트를 시험하다
모델 평가
cctest.ai
모델 평가

HyperBrowseComp, 다국어·멀티모달 웹 브라우징 에이전트를 시험하다

HyperBrowseComp는 웹 브라우징 에이전트를 위한 고난도 평가 벤치마크다. 13개 언어와 다양한 증거 형식을 대상으로, 단순 검색이 아니라 흩어진 단서를 발견하고 연결하며 검증하는 능력을 측정한다.

더 보기