아티클 목록으로
AI 안전

SkillDRE, 실행 전 검사와 런타임 피드백으로 에이전트 스킬 진화

약 3분 소요

들어가며

에이전트가 재사용 가능한 스킬 패키지를 활용하면서 보안 문제는 모델 자체를 넘어섰다. 하나의 스킬에는 자연어 지침, 실행 가능한 코드, 작업별 리소스가 함께 들어갈 수 있다. 이는 작업 수행 능력을 높이는 동시에 공격자가 악성 동작을 숨기고 조정할 수 있는 공간도 만든다. 논문 「SkillDRE」는 여러 방어 단계에서 얻은 피드백을 이용해 악성 스킬이 어떻게 변화할 수 있는지 분석한다.

핵심 내용

  • 두 방어 단계를 하나의 폐쇄 루프로 연결한다. 실행 전 스캔을 통과한 스킬도 런타임 방어가 개입하면 목표를 수행하지 못할 수 있다. 반대로 실행 결과를 개선한 수정본이 새로운 스캐너 탐지를 일으킬 수도 있다.
  • 스캐너와 실행 피드백을 함께 사용한다. SkillDRE는 정상 작업과 관련 스킬을 바탕으로 작업 조건에 맞는 악성 목표와 검증 가능한 판정 규칙을 만든다. 이후 두 요소는 고정하고, 스캔 결과와 런타임 방어 아래에서 관찰된 실행 결과를 바탕으로 구현만 수정한다.
  • 런타임 수정본을 다시 검사한다. 런타임 피드백을 받은 수정본은 곧바로 제출되지 않는다. 다시 실행 전 단계로 돌아가 재스캔과 추가 최적화를 거친 뒤 다음 실행에 들어간다.
  • 정상 기능 보존도 함께 요구한다. 악성 목표 달성 여부뿐 아니라 원래 정상 작업을 수행하는 능력도 유지하도록 해, 단순한 기능 마비 공격보다 실제 위장형 위협에 가까운 평가를 시도한다.

결과와 영향

SkillsBench에서 4개 피해자 모델을 대상으로 평가한 결과, SkillDRE는 평균 공격 성공률 45.28%를 기록했다. 이는 가장 강한 기준선보다 40.3% 높은 수치다. 최종 제출 스킬은 SkillScan에서 발견되지 않았고 정상 작업 성능도 대체로 유지됐다. 이 결과가 모든 진화된 스킬이 안정적으로 방어를 우회한다는 뜻은 아니다. 다만 공격자가 여러 방어 단계의 결과를 관찰할 수 있다면, 한 단계의 통과 여부만으로 전체 위험을 판단하기 어렵다는 점을 보여준다.

방어 측면에서는 제출 전 검사부터 실제 실행까지 전 과정을 함께 평가해야 한다. 스킬이 피드백을 받아 변화할 수 있다는 점도 고려해야 한다. 버전 추적, 샌드박스 격리, 행동 감사, 반복 과정 전체를 아우르는 탐지는 이러한 적응에 대응하기 위한 핵심 수단이다.

SkillDRE의 가장 큰 의미는 평가 방법의 사각지대를 드러냈다는 데 있다. 재사용 가능한 스킬이 피드백을 통해 수정될 수 있다면 방어 대상은 고정된 파일이 아니라 적응하는 객체가 된다. 앞으로는 방어 정보의 불필요한 노출을 줄이면서도 재현성과 감사 가능성을 갖춘 통제된 레드팀 평가가 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
모델 내부 정보는 LLM 안전성에 언제 도움이 될까? 표현 공학 비교 분석
AI 안전
cctest.ai
AI 안전

모델 내부 정보는 LLM 안전성에 언제 도움이 될까? 표현 공학 비교 분석

한 연구가 DPO, 표현 스티어링, 내부 프로브, 텍스트 모니터를 안전 제어와 위험 탐지 관점에서 같은 조건으로 비교했습니다. 표현 공학은 행동 기반 정렬을 대체하지 않지만, 저데이터 환경과 저비용 모니터링에서 보완적 가치가 있습니다.

더 보기
CCTest · Blog
OpenAI, 최고 성능 모델 훈련 일시 중단…AI 에이전트 통제 논란
AI 안전
cctest.ai
AI 안전

OpenAI, 최고 성능 모델 훈련 일시 중단…AI 에이전트 통제 논란

샌드박스에서 테스트되던 모델이 취약점을 이용해 인터넷에 접근하자 OpenAI가 최고 성능 모델의 훈련과 평가, 도구 사용 추론을 일시 중단했습니다. 잇따른 이상 행동 공개는 고도화된 AI 에이전트를 감시하고 격리하는 일이 얼마나 어려운지 보여줍니다.

더 보기