아티클 목록으로
모델 평가

구글 딥마인드, 모델과 시험 문제를 숨기는 이중 블라인드 AI 평가 시범 운영

약 3분 소요

AI 모델의 성능이 높아질수록 평가 점수가 실제 능력을 반영하는지 확인하는 일이 중요해지고 있다. 모델이 테스트 문제나 유사한 자료를 사전에 접했다면, 높은 점수는 일반화 능력보다 평가에 맞춘 최적화를 보여줄 수 있다. 구글 딥마인드는 2026년 8월 27일 이런 문제를 줄이기 위한 ‘이중 블라인드’ AI 평가 시범 사업을 공개했다.

이번 사업에는 싱가포르 AI 안전 연구소, OpenMined, AVERI, MLCommons가 참여한다. 파트너들은 기밀 벤치마크를 사용해 Gemini Flash Lite 모델을 개인정보 보호 환경에서 시험할 예정이다.

기존 평가의 딜레마

외부 평가를 진행하려면 평가 기관이 테스트 프롬프트를 모델 제공자에게 전달하거나, 제공자가 모델 가중치를 평가 기관에 제공하는 방식이 흔했다. 전자는 테스트 문제가 향후 모델 개선에 활용될 위험이 있고, 후자는 모델의 지식재산을 노출할 수 있다. 이중 블라인드 방식은 이 둘 중 하나를 포기해야 하는 구조를 바꾸려는 시도다.

  • 평가 기관은 Gemini의 모델 가중치를 볼 수 없다.
  • 구글은 평가 기관의 질문과 프롬프트를 볼 수 없다.
  • 실행은 Google Cloud의 기밀 컴퓨팅 포트폴리오에 포함된 Confidential Space에서 이뤄진다.
  • 암호학적 증거를 통해 모델과 평가 데이터가 지정된 보호 환경에 남았는지 확인한다.

벤치마크 오염을 줄이는 방법

벤치마크 오염은 모델이 평가 문항이나 유사한 내용을 사전에 학습한 상태를 의미한다. 그동안 제로 로깅 정책, 계약상 비밀유지 조항, 접근 통제가 주요 방어 수단으로 활용됐다. 이런 절차는 여전히 필요하지만, 상대방이 민감한 정보를 보지 않았다는 사실을 기술적으로 확인하기는 어려웠다.

암호학적으로 보호된 실행 환경은 이 문제를 보완한다. 평가 기관은 모델의 내부 자산을 받지 않고도 테스트를 수행할 수 있으며, 제공자는 기밀 프롬프트를 직접 보지 않아도 된다. 특히 사이버보안 평가나 정부 기관이 관리하는 민감한 시험에서는 데이터 주권과 보안성을 동시에 지키는 수단이 될 수 있다.

기대 효과와 남은 과제

이 접근법의 핵심 가치는 새로운 벤치마크를 만드는 데 있다기보다, 평가가 제대로 진행됐다는 신뢰를 기술적으로 뒷받침하는 데 있다. 외부 연구기관이 민감한 데이터를 넘기지 않고도 고성능 모델을 검증할 수 있다면, 모델 제공자의 내부 테스트에서 놓칠 수 있는 위험을 더 독립적으로 확인할 수 있다.

다만 이중 블라인드가 평가의 공정성을 자동으로 보장하는 것은 아니다. 테스트 세트의 품질, 지표 선택, 실행 조건, 결과 해석, 참여 기관의 독립성이 모두 결론에 영향을 준다. 이번 발표도 산업 표준의 확립이 아니라 시범 단계에 해당하므로, 기술 보고서와 외부 감사를 통해 다양한 모델 및 평가 유형에서 재현성을 확인해야 한다.

검증과 표준화가 이어진다면 이중 블라인드 평가는 신뢰할 수 있는 AI 감독 인프라의 한 요소가 될 수 있다. 정책 입안자와 연구자, 기업이 모델의 실제 능력과 사전 평가 적응의 결과를 더 명확히 구분하는 데 도움을 줄 가능성이 있다.

출처: Google DeepMind

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Video-IFBench, 동영상 멀티모달 모델의 지시 준수 능력 평가
모델 평가
cctest.ai
모델 평가

Video-IFBench, 동영상 멀티모달 모델의 지시 준수 능력 평가

Video-IFBench는 동영상을 정확히 이해하는지를 넘어 시각·음성·의미·형식·조건 분기를 포함한 복잡한 지시를 따르는지 평가한다. 20개가 넘는 최신 MLLM을 대상으로 한 평가에서 동영상 지시 준수의 어려움이 드러났다.

더 보기
CCTest · Blog
AnTrap이 드러낸 Android GUI 에이전트의 실행 중 취약성
모델 평가
cctest.ai
모델 평가

AnTrap이 드러낸 Android GUI 에이전트의 실행 중 취약성

AnTrap은 해결 가능한 Android 작업의 실행 과정에 현실적인 런타임 이상을 주입해 GUI 에이전트의 견고성을 평가한다. 실험 결과 대부분의 모델이 성능 저하를 보였으며, 학습으로 고칠 수 있는 오류와 더 깊은 추론 한계가 구분됐다.

더 보기