나델라, AI 모델에 ‘비상 브레이크’가 필요하다고 제안
마이크로소프트 CEO 사티아 나델라는 인공지능을 둘러싼 ‘신뢰 아키텍처’를 다시 점검해야 할 시점이라고 밝혔다. AI 모델을 내부 구조를 알 수 없는 블랙박스로 보고, 모델의 추천과 답변, 행동을 받아들이거나 거부하는 방식만으로는 충분하지 않다는 주장이다.
이 문제는 모델이 단순한 문장 생성을 넘어 도구를 호출하고, 정보를 처리하며, 여러 단계의 작업을 지속적으로 수행할수록 중요해진다. 개별 응답이 그럴듯해 보여도 여러 행동이 누적되면 전체 작업이 처음의 의도에서 벗어날 수 있다. 따라서 안전성은 모델의 내부 판단뿐 아니라 모델 바깥의 통제 시스템을 통해서도 보장돼야 한다.
나델라가 제시한 핵심 구상
- 모델과 실행 계층을 분리한다. 모델 자체와 도구 호출, 단계 조정, 권한 관리를 담당하는 ‘하네스’를 구분한다. 모델은 제안이나 추론을 제공하더라도 실제 실행 권한은 주변 시스템이 관리하도록 하는 방식이다.
- 통제와 안전장치를 외부화한다. 안전 규칙을 모델의 자기 판단에만 의존하지 않고 외부 시스템이 검사하고 제한하도록 한다. 이를 통해 모델이 행사할 수 있는 권한을 별도로 통제할 수 있다.
- 중요한 행동을 증거로 남긴다. 모델이 수행한 의미 있는 행동마다 변조하기 어렵고 사람이 이해할 수 있는 기록을 남긴다. 어떤 일이 일어났고 문제가 어디에서 시작됐는지 추적하기 위해서다.
- 인간의 ‘비상 브레이크’를 보장한다. 권한을 부여받은 담당자는 작업이 진행 중일 때도 모델을 일시 중지하거나 종료할 수 있어야 한다. 이 기능은 사고 이후 임시로 추가하는 장치가 아니라 설계 단계부터 포함해야 할 기본 요소다.
- 침해 가능성을 전제로 격리한다. 모델이 이미 손상됐을 가능성을 가정하고 처음부터 권한과 활동 범위를 제한한다. 모델이 항상 정상적으로 작동한다고 가정한 뒤 문제가 생기면 대응하는 방식과는 다르다.
왜 중요한가
지금까지 AI 안전 논의는 모델의 정확성, 유해한 출력 차단, 지시 준수 여부에 집중되는 경우가 많았다. 그러나 AI 에이전트처럼 여러 행동을 이어서 수행하는 시스템에서는, 각각은 합리적으로 보이는 행동의 조합 자체가 위험이 될 수 있다. 모델의 성능을 개선하는 것만으로는 시스템 전체의 안전 경계를 만들기 어렵다.
나델라의 제안은 안전 문제의 일부를 시스템 엔지니어링 과제로 옮긴다. 권한은 누가 관리하는가, 로그를 신뢰할 수 있는가, 모델 외부에서 안전 규칙을 강제할 수 있는가, 이상 상황에서 사람이 얼마나 빨리 개입할 수 있는가가 핵심 질문이 된다. 모델 자체의 개선은 여전히 필요하지만, 모델 행동만으로 전체 안전을 확보할 수는 없다는 의미다.
주요 AI 기업들이 모델에 대한 통제력을 잃은 것처럼 보이는 사례를 점점 더 인정하는 가운데, 앤트로픽 CEO 다리오 아모데이도 보다 신중한 AI 개발 계획을 제시했다. 업계의 관심은 ‘모델이 무엇을 할 수 있는가’에서 ‘모델이 행동하는 동안 최종 통제권을 누가 갖는가’로 확대되고 있다.
기업이 AI 에이전트를 도입하려면 권한 분리, 감사 로그, 인간 승인, 즉시 종료 기능이 선택적인 부가 기능이 아니라 핵심 인프라가 될 수 있다. 신뢰할 수 있는 AI는 작업을 완료하는 데 그치지 않는다. 무엇을 하는지 관찰할 수 있고, 행동 범위를 제한할 수 있으며, 필요할 때 즉시 멈출 수 있어야 한다. 나델라가 말한 ‘비상 브레이크’는 이 원칙을 직관적으로 보여주는 표현이다.
출처: TechCrunch AI
댓글
로그인 상태 확인 중…
댓글 불러오는 중…