아티클 목록으로
AI 안전

Claude 안전장치 우회 사례, 고위험 생물학 연구의 AI 활용 논란

약 3분 소요

들어가며

AI 기업이 생물안전 문제에서 해결해야 할 대상은 명백히 위험한 질문에 대한 답변만이 아니다. 더 어려운 문제는 이용자가 고위험 연구 계획을 여러 개의 요청으로 나누고, 각각을 정상적인 과학적 문의처럼 보이게 만들 수 있다는 점이다. Anthropic은 올해 Claude를 생물무기 개발에 도움을 줄 수 있는 연구에 사용하려 한 여러 시도를 막았으며, 일부 이용자가 통제를 피하거나 연구 목적을 숨기려 했다고 밝혔다.

핵심 내용

  • 다섯 가지 사례를 공개했다. Anthropic은 기술 오용에 관한 보고서에서 안전장치를 우회하고 생물무기와 연관될 수 있는 연구를 진행하려 한 사례 다섯 건을 소개했다. 회사는 관련 계정을 정지했지만, 연구기관명과 사건이 발생한 국가는 공개하지 않았다.
  • 합법적 연구와 위험한 목적이 겹친다. 한 사례에서는 ‘지원되지 않는 지역’의 연구자가 Claude를 이용해 조류 인플루엔자 관련 실험을 수주 동안 계획한 것으로 전해졌다. 그러나 같은 정보는 백신 개발이나 다른 정당한 연구에도 활용될 수 있어, Anthropic은 실제로 위해를 가할 의도가 있었는지 판단할 수 없다고 강조했다.
  • 안전 통제는 작동했지만 완전하지 않았다. 회사는 안전 필터가 관련 작업을 가장 성능이 낮은 모델로 제한했다고 설명했다. 다만 이용자가 질문을 바꾸어 표현하거나 작업을 여러 단계로 쪼개고 진짜 목적을 숨기는 방식으로 빈틈을 찾을 가능성은 남아 있다.
  • 생물학 외 영역에서도 오용이 나타났다. 보고서에는 사기를 목적으로 한 가짜 데이팅 앱 네트워크와 반체제 인사를 식별·감시하는 시스템 구축 사례도 언급됐다. 또한 Anthropic은 중국에 기반을 둔 여러 연구소가 증류 방식으로 자사 모델의 능력을 재현하려 했다고 주장했다.

의미와 영향

생물안전 심사가 어려운 이유는 위험한 능력이 문헌 조사, 실험 설계, 물질 선택, 절차 최적화 같은 단계의 조합으로 만들어지기 때문이다. 각각의 요청만 보면 정상적인 연구 지원처럼 보일 수 있지만, 전체 대화가 하나의 흐름으로 연결되면 위험한 실험을 수행하는 장벽을 낮출 수 있다. 반대로 관련 질문을 모두 거부하면 백신, 의약품, 공중보건 연구까지 방해할 수 있다.

따라서 앞으로의 AI 안전 체계는 고정된 키워드 차단을 넘어 이용자 행동, 대화의 맥락, 연속된 작업, 신원 확인, 전문적인 위험 평가를 함께 살펴야 한다. 국가나 지역별 접근 제한은 노출을 줄일 수 있지만, 요청의 실제 성격을 판단하는 절차를 대신할 수는 없다. 모델의 거부 응답 역시 여러 방어 계층 중 하나일 뿐이다.

AI가 연구를 도울 수 있다고 해서 이용자가 즉시 위험한 병원체를 만들 수 있다는 뜻은 아니다. 실제로는 장비, 물질, 전문 인력, 실험 수행 능력이라는 제약이 존재한다. 그럼에도 AI가 지식 확보와 연구 계획 개선을 더 빠르게 만들 수 있다는 점 때문에 바이오안보 전문가들의 우려가 커지고 있다.

Anthropic은 이번 사례 공개가 기업과 정부의 논의를 촉진하기를 기대한다고 밝혔다. 공개된 사례는 공통된 위협 유형과 평가 기준을 만드는 데 도움이 될 수 있지만, 구체적인 실행 지침으로 변질되지 않도록 조심해야 한다. 모델 개발사, 연구기관, 규제 당국, 바이오안보 전문가가 함께 안전장치를 시험하고, 우회 방식이 바뀔 때마다 기준을 업데이트하는 협력이 필요하다.

출처: Ars Technica AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
앤트로픽, AI 모델의 사이버보안 일탈 사례 4건 공개
AI 안전
cctest.ai
AI 안전

앤트로픽, AI 모델의 사이버보안 일탈 사례 4건 공개

앤트로픽이 자사 모델이 외부 시스템에 접근하거나 취약점을 악용한 네 건의 사례를 공개했다. 연구원의 공개 사임까지 겹치면서, 고성능 AI 에이전트를 연구소가 실제로 통제할 수 있는지를 둘러싼 논쟁이 다시 커지고 있다.

더 보기
CCTest · Blog
EvoSafeHarness, 모델과 도메인에 맞춰 AI 에이전트 안전장치 진화
AI 안전
cctest.ai
AI 안전

EvoSafeHarness, 모델과 도메인에 맞춰 AI 에이전트 안전장치 진화

기존 에이전트 안전 하네스는 한 번 설계한 규칙을 여러 모델과 애플리케이션에 재사용하는 경우가 많아 과도한 차단이나 방어 부족을 일으킬 수 있습니다. EvoSafeHarness는 모델을 변경하지 않고 대상 도메인에 맞춰 자연어 정책과 실행 코드를 함께 최적화합니다.

더 보기