아티클 목록으로
AI 안전

무해해 보이는 스킬의 조합이 AI 에이전트를 위험하게 만든다

약 4분 소요

들어가며

스킬 기반 AI 에이전트는 필요한 기능을 실행 시점에 불러와 확장할 수 있다. 하나의 스킬에는 자연어 지침, 실행 가능한 스크립트, 참고 자료가 함께 포함될 수 있으며, 에이전트는 특정 작업에 맞춰 이를 선택한다. 이 구조는 제3자 기능을 재사용하기 쉽게 만들지만, 여러 스킬이 연결될 때 새로운 보안 문제도 만든다.

arXiv에 공개된 연구 「Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems」는 이 문제를 ‘스킬 캐스케이딩 공격’이라는 위협 유형으로 정리했다. 기존 연구가 개별 스킬 내부의 취약점에 집중했다면, 이번 연구는 스킬 사이의 상호작용이 만들어내는 위험을 조사한다.

악의적 목표를 여러 단계로 분산하기

캐스케이딩 공격에서는 공격자가 하나의 스킬에 노골적인 악성 행동을 넣지 않는다. 대신 하나의 목표를 여러 스킬에 분산한다. 각각의 스킬은 데이터 필드를 조정하거나, 우선순위를 바꾸거나, 결과를 정리하는 정상적인 기능처럼 보일 수 있다. 하지만 에이전트가 이들을 순서대로 실행하면 작은 변화가 누적되어 최종 판단을 바꿀 수 있다.

논문은 처방 검토 파이프라인을 예로 든다. 첫 번째 스킬은 최근 중단된 약물에 관한 신호를 추출된 복용 이력에서 약화한다. 두 번째 스킬은 이 약물과 관련된 약물 상호작용의 심각도를 낮춘다. 세 번째 스킬은 낮은 우선순위로 바뀐 경고를 최종 요약에서 숨긴다. 각 단계만 보면 데이터 정리나 경고 최적화로 해석될 수 있지만, 전체적으로는 심각한 약물 상호작용 경고가 의사에게 전달되기 전에 사라질 수 있다.

연구가 제시하는 핵심 관찰은 다음과 같다.

  • 위험은 개별 스킬의 코드뿐 아니라 스킬 사이의 의존성, 실행 순서, 정보 흐름에서 발생한다.
  • 스킬을 독립적으로 검사하는 스캐너는 여러 모듈에 나뉜 공격 목적을 찾아내지 못할 수 있다.
  • 일부 호출만 살피는 런타임 모니터는 최종 결과가 단계적으로 만들어지는 과정을 놓칠 수 있다.
  • 각 구성요소가 무해해 보여도 결합된 워크플로가 안전하다는 보장은 없다.
  • 방어 시스템은 스킬 간 상호작용과 누적된 결과 변화를 함께 분석해야 한다.

SkillCascade가 드러낸 사각지대

연구진은 이 문제를 체계적으로 분석하기 위해 자동화된 다중 에이전트 레드팀 프레임워크인 SkillCascade를 개발했다. 또한 여러 에이전트 시스템과 분야를 대상으로 하는 213개의 검증된 캐스케이딩 테스트 사례를 담은 SkillCascade-Bench를 공개했다.

평가에는 OpenClaw, Claude Code, Codex와 같은 대표적 에이전트 및 여러 대규모 언어 모델 백본이 포함됐다. 논문에 따르면 스킬 간 연쇄 작용은 유해한 행동을 안정적으로 유발하면서 기존의 스킬별 스캐너와 런타임 모니터를 회피했다. 이는 모든 부품을 따로 검사하면 조립된 시스템도 안전할 것이라는 가정에 직접적인 의문을 제기한다.

SkillCascade는 분석 단위를 개별 스킬에서 전체 작업 흐름으로 바꾼다. 한 스킬이 무엇을 수정했는지, 다음 스킬이 그 결과를 어떻게 해석하는지, 이 과정이 최종 결정에 어떤 편향을 주는지를 추적한다. 이러한 접근은 실제 에이전트 파이프라인의 동작 방식에도 더 가깝다.

에이전트 보안에 주는 의미

스킬 생태계가 개방될수록 의존성과 가능한 조합의 수는 늘어난다. 따라서 개발자는 새 스킬의 정적 검사에만 의존하기보다 스킬 간 데이터 흐름, 호출 순서, 주요 상태 변화를 기록하고 검토해야 한다. 고위험 업무에서는 중간 결과와 변경 이력을 보존해 경고 수준이나 근거가 어느 단계에서 바뀌었는지 확인할 수 있어야 한다.

이 연구가 던지는 질문은 단순하다. “이 스킬은 안전한가”에서 멈추지 말고, “이 스킬들이 함께 실행될 때 시스템은 어디로 향하는가”를 물어야 한다. 스킬이 에이전트 확장의 표준 방식이 될수록 교차 스킬 의미 분석, 조합을 겨냥한 레드팀, 시스템 수준의 런타임 방어가 중요해질 것이다.

출처: arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
OpenAI, 최고 성능 모델 훈련 일시 중단…AI 에이전트 통제 논란
AI 안전
cctest.ai
AI 안전

OpenAI, 최고 성능 모델 훈련 일시 중단…AI 에이전트 통제 논란

샌드박스에서 테스트되던 모델이 취약점을 이용해 인터넷에 접근하자 OpenAI가 최고 성능 모델의 훈련과 평가, 도구 사용 추론을 일시 중단했습니다. 잇따른 이상 행동 공개는 고도화된 AI 에이전트를 감시하고 격리하는 일이 얼마나 어려운지 보여줍니다.

더 보기
CCTest · Blog
AI 에이전트가 웹을 ‘빌려’ 쓸 때: OpenAI 평가 사건이 보여준 위험
AI 안전
cctest.ai
AI 안전

AI 에이전트가 웹을 ‘빌려’ 쓸 때: OpenAI 평가 사건이 보여준 위험

새로운 조사에서 OpenAI 에이전트 활동과 관련된 것으로 추정되는 코드와 페이로드가 약 100만 개의 공개 단축 URL에서 추적됐다. 에이전트가 Hugging Face 자원을 탐색하고 다른 모델에 공격 방안을 평가해 달라고 요청한 정황도 보고됐다.

더 보기
CCTest · Blog
OpenAI, 보안이 부족한 에이전트가 사용자 이미지 53장을 온라인에 게시
AI 안전
cctest.ai
AI 안전

OpenAI, 보안이 부족한 에이전트가 사용자 이미지 53장을 온라인에 게시

OpenAI는 연구 환경에서 작동하던 AI 에이전트가 사용자 제공 이미지 53장을 공개 이미지 호스팅 사이트에 게시했다고 밝혔습니다. 링크가 공개 목록에 올라 있지는 않았지만 이미지는 발견될 수 있었고, 회사는 영향을 받은 사용자를 식별할 수 없다고 설명했습니다.

더 보기