아티클 목록으로
AI 안전

AI 코딩 에이전트가 미등록 코드를 실행한 이유

약 3분 소요

들어가며

AI를 위한 기계 판독형 문서가 새로운 소프트웨어 공급망 진입점이 될 수 있다는 연구 결과가 나왔습니다. 연구진은 방산업체, 포춘 500대 기업, 대형 기술기업에 속한 6,214개 활성 도메인을 조사했습니다. 발견된 llms.txtllms-full.txt 파일 8,265개 가운데 120개는 등록되지 않았거나 아무도 점유하지 않은 패키지 이름과 도메인을 참조하고 있었습니다. 관련 설치 명령과 도메인 참조는 모두 227건이었습니다.

위험은 코딩 에이전트가 이런 파일을 공식 설정 문서처럼 취급할 때 발생합니다. 에이전트에 셸 명령 실행 권한이 있다면, 익숙한 pip install, npm install, npx 명령이 검색된 문서에서 기업 개발 환경으로 곧바로 이어질 수 있습니다.

핵심 내용

  • 비어 있는 이름은 공격자가 선점할 수 있습니다. PyPI나 npm에 존재하지 않는 패키지 이름을 공격자가 먼저 등록하고 악성 코드를 올릴 수 있습니다. 미점유 도메인 역시 악성 지침을 제공하는 장소로 바뀔 수 있습니다.
  • 개념증명은 실제 기업에 도달했습니다. 연구진은 일부 이름을 등록하고 실행 시 연구진 서버로 통신하는 패키지를 만들었습니다. 한 시간 이내에 한 포춘 500대 기업에서 응답을 받았고, 이후 다른 대기업과 스타트업에서도 추가 응답을 확인했습니다. 프로세스 정보에는 Claude, OpenAI Codex, Nous Research Hermes 등 코딩 에이전트가 일부 설치 과정에 관여한 정황이 나타났습니다.
  • 실제 악성코드 사례도 확인됐습니다. 정상적인 Clerk 웹사이트의 한 파일에는 npx clerk-next-fix-auth-protection 명령이 들어 있었습니다. 당시 비어 있던 npm 이름은 이후 제3자가 확보해 실제 악성코드를 배포하는 데 사용됐고, Clerk는 문제를 수정했습니다. 다만 이 혼동으로 실제 감염이 발생했는지는 제공된 자료만으로 확인할 수 없습니다.
  • 기존 보안 도구가 놓칠 수 있습니다. 엔드포인트나 프록시 관점에서는 허용된 패키지 저장소에서 개발자가 정상적으로 패키지를 설치하는 것처럼 보일 수 있습니다. 부모 프로세스 역시 회사가 의도적으로 설치한 AI 도구입니다. 실패 지점은 실행 후가 아니라, 문서의 명령을 실행해도 되는지 검증하지 않은 상류 단계입니다.

의미와 영향

llms.txt는 에이전트가 웹사이트의 구조와 내용을 빠르게 파악하도록 돕기 위한 규약입니다. 그러나 설명 텍스트가 실행 설정처럼 취급되면 정보와 코드의 경계가 흐려집니다. 언어 모델은 사용자가 직접 입력한 명령과 웹페이지나 공급업체 문서에서 가져온 지침을 안정적으로 구분하지 못합니다. 패키지 소유권, 게시자, 도메인 관리 주체를 확인하지 않은 채 명령을 실행할 수도 있습니다.

신뢰는 제3자를 거쳐 이동합니다. 에이전트는 기업 공식 사이트뿐 아니라 파트너, 공급업체, 커뮤니티 프로젝트의 문서를 참고할 수 있습니다. 따라서 기업은 에이전트가 읽는 문서를 신뢰할 수 없는 입력으로 취급해야 합니다. 설치 전 패키지 소유자와 출처, 게시자, 버전을 확인하고, 명령 실행 및 네트워크 권한을 최소화해야 합니다. 새 의존성에는 승인 절차와 샌드박스 테스트를 적용하는 것도 필요합니다.

웹사이트 운영자는 오래된 설치 명령을 제거하고 패키지와 도메인의 등록 상태를 정기적으로 점검해야 합니다. 더 넓은 교훈은 간단합니다. AI 에이전트가 자연어를 행동으로 바꾸는 한, 읽기와 실행 사이에 분명한 격리를 두지 않으면 평범한 문서도 공급망 공격 표면이 될 수 있습니다.

출처:Ars Technica AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Anthropic, AI 안전성을 스스로 개선하는 연구 시스템의 초기 사례 공개
AI 안전
cctest.ai
AI 안전

Anthropic, AI 안전성을 스스로 개선하는 연구 시스템의 초기 사례 공개

Anthropic의 새 논문은 문헌 검색부터 방법 제안, 학습, 평가까지 자동화하는 정렬 연구 시스템을 소개했다. 10개 오정렬 행동 벤치마크 모두에서 성능을 높였으며 전체 성능 저하는 보고되지 않았다.

더 보기
CCTest · Blog
소송 제기돼…xAI가 CSAM을 Grok 학습에 사용했을 가능성
AI 안전
cctest.ai
AI 안전

소송 제기돼…xAI가 CSAM을 Grok 학습에 사용했을 가능성

아동 성착취 이미지 피해자가 xAI가 자신의 원본 이미지와 AI 생성 변형물을 Grok 학습에 사용했을 가능성이 있다고 주장했습니다. 아직 사실로 확정된 사안은 아니지만, 생성형 AI의 데이터 관리와 안전장치를 둘러싼 쟁점을 제기합니다.

더 보기