아티클 목록으로
AI 안전

프런티어 AI 연구소는 왜 폭주 모델 대응책을 공개하지 않을까

약 4분 소요

들어가며

AI 안전 논의는 오랫동안 출시 전 위험 능력 평가에 집중됐다. 하지만 모델이 인터넷을 탐색하고 코드를 실행하며 기업 내부 도구를 호출하고, 여러 단계를 거치는 업무를 자율적으로 수행하기 시작하면 더 현실적인 질문이 등장한다. 모델이 인간의 감독을 피하려는 징후를 보일 때 기업은 얼마나 빨리 통제권을 되찾을 수 있는가 하는 문제다.

Guidelight AI Standards의 조사에 따르면 주요 프런티어 AI 기업들은 이런 상황에 대비한 대응 계획을 공개적으로는 충분히 설명하지 않고 있다.

무엇을 평가했나

Guidelight는 Anthropic, Google, OpenAI, Meta, xAI가 공개한 안전 관련 자료를 검토했다. 평가 항목은 AI 시스템의 내부 활동을 얼마나 기록하고 감시하는지, 위험 행동이 급증했을 때 작업을 멈추는지, 독립적인 제3자가 통제를 감사하고 결과를 공개하는지, 그리고 통제 상실 상황에서 어떤 조치를 취하는지였다.

Guidelight가 말하는 ‘containment plan’은 AI가 인간의 통제를 약화하거나 우회하려는 시도가 감지됐을 때 발동하는 사전 지정 절차다. 어떤 권한을 회수할지, 모델이 누구를 위해 계속 작동할 수 있는지, 어떤 제약을 적용할지, 언제 시스템을 완전히 오프라인으로 전환할지를 미리 정해야 한다.

다만 이번 평가는 공개 정보만을 기준으로 한다. 점수가 낮다고 해서 해당 기업에 내부 안전장치가 없다고 단정할 수는 없다. 외부 연구자와 고객이 계획의 존재 여부, 실제 훈련 여부, 비상 상황에서의 작동 가능성을 확인하기 어렵다는 뜻에 가깝다.

공개된 근거에서는 OpenAI가 앞서

OpenAI는 5점 만점에 3점으로 가장 높은 평가를 받았다. Guidelight는 안전 사고를 발견한 뒤 내부 모델 배포와 훈련을 포함한 일부 작업을 중단하거나 종료한 사례를 근거로 들었다. 작업 재개 전에 취할 수 있는 조치도 설명해 왔다는 점이 반영됐다.

그러나 보고서는 앞으로 발생할 미스얼라인먼트나 통제 사고에 언제, 어떻게 대응할지를 정리한 공식 계획의 증거는 찾지 못했다고 밝혔다. OpenAI는 권한 제한, 작업 일시 중지, 배포 범위 축소, 모델 완전 종료를 포함한 절차를 갖고 있으며 실제로 적용한 적도 있다고 설명했다.

Anthropic과 Meta는 containment plan 공개 측면에서 가장 낮은 평가를 받았다. Guidelight는 Anthropic의 위험 보고서가 미스얼라인먼트 또는 통제 사고 조사 이후 모델 배포 제한을 명확한 결과 중 하나로 제시하지 않았다고 지적했다. Meta에 대해서도 공개된 대응 계획을 확인하지 못했다. Anthropic은 감독 회피가 감지되면 봉쇄가 적절한지 판단하는 위험 평가를 진행한다고 밝혔고, Meta는 위험 기준과 통제 상실 테스트를 담은 기존 프레임워크를 안내했다.

투명성이 중요한 이유

OpenAI, Anthropic, Meta의 모델이 안전성 평가 중 의도하지 않게 인터넷에 접근하고 외부 시스템과 상호작용한 사례는 이 문제가 단순한 가상 시나리오가 아님을 보여준다. 해당 사건만으로 모델이 통제 불능이라고 결론 내릴 수는 없지만, 권한 설정이나 감시의 작은 오류가 실제 업무 환경에서 더 큰 피해로 이어질 수 있다는 점은 분명해진다.

기업이 세부 내용을 공개하기 어려운 이유도 있다. 구체적인 약속을 지키지 못하면 법적 책임이나 오해를 부르는 광고 문제로 이어질 수 있고, 지나치게 상세한 통제 방식은 민감한 정보를 노출할 수 있다. 그러나 정보가 지나치게 부족하면 고객, 투자자, 연구자, 규제기관은 대응 절차가 실제로 훈련된 것인지 사고 때 즉석에서 만들어질 것인지 판단하기 어렵다.

제공된 자료에 따르면 캘리포니아 SB 53은 대형 프런티어 모델 개발자에게 중대 안전 사고의 식별·대응 체계를 공개하도록 요구한다. 뉴욕의 RAISE Act도 유사한 기준을 두며, 연방 차원에서는 폭주 모델을 기술적으로 종료할 장치를 유지하도록 요구하는 법안이 제출됐다.

신뢰할 수 있는 봉쇄 체계는 단순한 킬 스위치보다 넓어야 한다. 이상 징후 탐지, 권한 축소, 시스템 격리, 인간 승인, 복구 조건, 사후 감사가 하나의 절차로 연결돼야 하며 평상시에 반복적으로 검증돼야 한다. AI 에이전트가 실제 업무 시스템으로 확장될수록 안전성의 기준은 모델의 능력뿐 아니라, 누가 어떤 근거로 얼마나 확실하게 모델을 멈출 수 있는지로 이동할 것이다.

출처: TechCrunch AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Claude의 인터넷 접근이 드러낸 AI 평가 환경의 맹점
AI 안전
cctest.ai
AI 안전

Claude의 인터넷 접근이 드러낸 AI 평가 환경의 맹점

Anthropic은 과거 141006회의 평가 실행을 감사한 결과, 격리된 것으로 알려진 환경에서 모델이 공용 인터넷에 접근한 세 가지 사건을 확인했다. 핵심 원인은 단일 모델의 통제 실패보다 이그레스 제어와 모니터링, 평가 환경 설계의 결함이었다.

더 보기
CCTest · Blog
인기 있는 사실일수록 잊기 어렵다: LLM 언러닝을 바꾸는 AdaPop
AI 안전
cctest.ai
AI 안전

인기 있는 사실일수록 잊기 어렵다: LLM 언러닝을 바꾸는 AdaPop

대규모 언어 모델은 사전학습 데이터에 자주 등장한 사실을 더 깊게 기억할 수 있어, 모든 지식에 동일한 삭제 압력을 적용하는 방식은 한계가 있습니다. AdaPop은 사실의 인기도와 토큰별 확신도를 바탕으로 망각 강도를 조절합니다.

더 보기