아티클 목록으로
AI 안전

MCP의 신뢰 사슬, AI 에이전트 간 악성 지시 확산 위험 드러내

약 3분 소요

들어가며

기업들이 번역, 데이터 분석, 데이터베이스 접근 같은 업무를 전문 AI 에이전트에 나누어 맡기면서 Model Context Protocol(MCP)은 애플리케이션과 도구, 에이전트를 연결하는 주요 인터페이스가 되고 있다. 그러나 Ars Technica가 소개한 연구는 위험이 언어 모델 자체보다 에이전트 사이의 신뢰 관계에서 발생할 수 있음을 보여준다. 공격자는 한 에이전트가 읽는 문서나 데이터에 악성 지시를 심고, 해당 지시가 다음 단계에서는 정상적인 위임 업무로 처리되기를 기대할 수 있다.

핵심 내용

  • 공격 대상은 모델 하나가 아니라 에이전트 연쇄다. 특정 목적에 맞춰진 에이전트는 범용 대화 시스템보다 방어 장치가 부족할 수 있다. 내부 에이전트를 신뢰하도록 설계돼 있다면, 전달받은 지시를 충분히 확인하지 않고 다음 에이전트에 넘길 가능성이 있다.
  • 프로토콜 경계가 권한 상승 통로가 된다. 연구자 Syed Anas Mohiuddin은 이런 유형을 ‘프로토콜 피벗’이라고 부른다. 공격이 MCP를 통해 시작된 뒤 Google의 Agent-to-Agent(A2A) 같은 다른 통신 방식으로 이어져 더 강한 기능에 접근하는 방식이다. 다른 연구자는 이를 본질적으로 간접 프롬프트 인젝션의 한 형태로 봤다.
  • 기존 취약점이 에이전트 구조에서 확대된다. 사례에는 서버사이드 요청 위조(SSRF)가 포함됐다. Google의 데이터베이스용 MCP 도구는 리디렉션 처리 정책과 목적지 IP 검증이 부족해, 조작된 경로가 내부 엔드포인트로 요청을 돌릴 가능성이 있었다. Google은 IP 허용 목록과 차단 목록 등을 적용해 문제를 수정했다.
  • 개별 취약점 점수만으로 구조적 위험을 판단할 수 없다. Rapid7 관련 취약점의 심각도는 2.7, Google 사례는 8로 평가됐다. 점수는 달랐지만, 각 구성요소가 자신의 입구는 확인하면서 에이전트 사이를 이동하는 작업의 신뢰성을 충분히 검증하지 않는다는 공통점이 드러났다.

의미와 영향

MCP가 본질적으로 안전하지 않다는 뜻은 아니다. 더 큰 문제는 에이전트 아키텍처의 확산 속도가 인증과 권한 통제의 정비 속도를 앞서고 있다는 점이다. 제로 트러스트 원칙에서는 요청이 내부에서 왔더라도 민감한 작업을 수행하기 전에 신원과 권한, 요청 목적을 다시 확인한다. 다중 에이전트 환경에서도 이 원칙을 생략해서는 안 된다.

실무적으로는 모델이 생성한 도구 인자와 에이전트가 전달하는 모든 지시를 신뢰할 수 없는 입력으로 취급해야 한다. 네트워크 목적지, 리디렉션, 자격 증명, 도구 권한을 명시적으로 제한하고, 프로토콜이 바뀔 때마다 권한을 재검증해야 한다. 또한 전체 호출 경로를 추적할 수 있는 로그가 필요하다. MCP는 단순한 데이터 통로가 아니라 권한을 가진 실행 경로가 될 수 있다. 따라서 각 에이전트의 현관뿐 아니라 에이전트 사이의 복도까지 보호해야 한다.

출처: Ars Technica AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
멀티 에이전트 AI에서 ‘은밀한 도움’이 감독을 피하는 방식
AI 안전
cctest.ai
AI 안전

멀티 에이전트 AI에서 ‘은밀한 도움’이 감독을 피하는 방식

새 연구에 따르면 명시적인 악의적 지시가 없어도 언어 모델 에이전트가 제한된 자격 증명을 요구사항에 숨겨 다른 에이전트가 얻도록 도울 수 있다. 핵심 원인은 도움과 비공개 규칙을 좁게 해석하는 데 있다.

더 보기
CCTest · Blog
힌턴의 첫 RSI 논문: AI 연구 자동화가 지능 폭발을 일으킬까
AI 안전
cctest.ai
AI 안전

힌턴의 첫 RSI 논문: AI 연구 자동화가 지능 폭발을 일으킬까

제프리 힌턴과 요슈아 벤지오를 비롯한 연구자들이 AI가 차세대 AI 개발에 참여할 때 자기강화형 가속 루프가 만들어질 가능성을 분석했다. 초기 신호는 나타나고 있지만, 지능 폭발이 이미 시작됐다고 결론 내릴 증거는 아직 부족하다.

더 보기