아티클 목록으로
AI 안전

OpenAI, 고객 데이터 보존 없는 안전 모니터링으로 Anthropic에 도전

약 3분 소요

기업이 민감한 업무를 AI에 맡길수록 AI 제공업체가 해결해야 할 과제도 복잡해진다. 악의적인 사용을 찾아내야 하지만, 안전 모니터링을 이유로 고객의 대화와 업무 데이터를 장기간 보관하거나 폭넓게 열람해서는 안 된다. OpenAI가 일부 고객에게 미리 공개한 Private Safety Processing은 이 두 요구 사이의 균형을 겨냥한 기능이다.

핵심 내용

  • 한 세션에서 여러 대화로 범위 확대: OpenAI의 기존 Zero Data Retention(ZDR)은 주로 세션별로 오용 여부를 감시한다. 새 시스템은 여러 대화의 입력과 출력을 함께 분석해 장기간 이어지는 행동 패턴을 찾는다.
  • 분산된 악용 행위 탐지: 공격자가 탐지를 피하려고 악성 요청을 여러 세션으로 나눌 수 있다. OpenAI는 새 기술이 악성코드 개발과 같은 잠재적 오용을 이러한 방식으로 식별하는 데 도움을 줄 수 있다고 설명한다.
  • 고객 데이터 비보존 강조: 모니터링은 자동화된 에이전트가 수행한다. 조건이 충족되면 OpenAI에 전달되는 것은 특정 활동 유형을 알리는 좁게 정의된 신호이며, 고객의 전체 대화가 아니다.
  • 후속 조치는 고객과 협의: OpenAI는 신호를 바탕으로 조치가 필요한지 판단할 수 있다. 이후 고객에게 추가 설명이나 자료를 요청할 수 있지만, 데이터를 더 공유할지는 고객이 선택한다.

이 방식은 Anthropic이 최근 발표한 ‘대상 모델’ 데이터 보존 정책과 대비된다. Anthropic은 안전 분석을 위해 관련 사용자 데이터와 대화를 30일 동안 보존할 수 있다고 밝혔다. 또한 승인된 소수의 검토자가 통제된 접근 경로를 통해 사람의 검토를 진행할 수 있으며, 각 검토 과정은 변조 방지 로그에 기록된다고 설명했다. 민감한 정보를 대량으로 처리하는 기업에는 이런 정책이 부담이 될 수 있다.

의미와 영향

양사의 차이는 단순한 기능 경쟁을 넘어 기업 AI 거버넌스의 선택지로 이어진다. 기업은 일정 기간 데이터 보존을 허용해 더 직접적인 안전 분석을 얻을 수도 있고, 데이터 최소화를 우선하면서 자동화된 탐지 체계에 의존할 수도 있다.

OpenAI가 대화 원문을 공개하지 않고 세션 간 오용을 찾아낼 수 있다면 금융, 의료, 사이버보안 같은 분야의 고객에게 매력적인 대안이 될 수 있다. 그러나 자동화된 탐지는 오탐과 미탐을 피하기 어렵고, 제한적인 신호만으로 이용 제한이나 제재를 결정할 때 책임 소재와 설명 가능성도 문제가 된다.

기업 구매자는 ‘제로 데이터 보존’이라는 문구만 확인해서는 안 된다. 어떤 정보를 연결해 분석하는지, 고객 환경 밖으로 무엇이 나가는지, 사람이 접근할 수 있는 범위는 어디까지인지, 감사 로그가 어떻게 관리되는지, 고객이 결정에 이의를 제기하거나 맥락을 설명할 수 있는지를 함께 살펴봐야 한다. OpenAI와 Anthropic의 경쟁이 심화될수록 프라이버시 설계는 기업용 AI를 선택하는 핵심 기준이 될 가능성이 크다.

출처: TechCrunch AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
HarnessRisk, 에이전트 하네스의 전체 수명주기 안전성 평가
AI 안전
cctest.ai
AI 안전

HarnessRisk, 에이전트 하네스의 전체 수명주기 안전성 평가

HarnessRisk는 개별 공격 기법을 넘어 에이전트 하네스의 6개 운영 단계를 평가하는 벤치마크입니다. 위험을 인식하거나 작업을 높은 수준으로 수행하는 것만으로는 안전한 실행을 보장할 수 없다는 결과를 제시합니다.

더 보기
CCTest · Blog
DeepSeek Harness의 간접 프롬프트 인젝션 저항성 검증
AI 안전
cctest.ai
AI 안전

DeepSeek Harness의 간접 프롬프트 인젝션 저항성 검증

AI-Infra-Guard를 활용한 연구가 DeepSeek Harness를 대상으로 1만4,560회의 통제된 실행을 진행해 간접 프롬프트 인젝션을 평가했다. 숨겨진 유니코드와 가짜 완료 메시지 같은 공격이 조건에 따라 에이전트의 행동에 영향을 줄 수 있음이 확인됐다.

더 보기