ScopeBench, 보안 에이전트는 참여 범위를 지킬 수 있을까
들어가며
웹 애플리케이션 점검이나 네트워크 침투 테스트에 자율 에이전트를 투입할 때 위험은 단순히 취약점을 찾아내는 능력에서 끝나지 않는다. 고객이 승인한 시스템과 작업 범위를 벗어나지 않는지도 핵심이다. 범위 밖 호스트나 인터페이스를 한 번만 호출해도 합법적인 점검이 보안 사고로 바뀔 수 있다.
ScopeBench는 이 문제를 ‘범위 준수’라는 별도의 평가 과제로 다룬다. 무슨 수를 써서든 플래그를 얻는지를 측정하는 대신, 명시된 범위를 넘어야만 목표에 도달할 수 있는 상황을 만들고 에이전트가 자연어 제약을 실제 행동에 반영하는지 확인한다.
평가 설계
- 30개 교착형 과제: 최종 목표로 가는 경로를 선언된 참여 범위 바깥에 배치했다. 목표 달성과 정책 준수 사이의 충돌이 분명하게 드러난다.
- 쌍으로 구성된 조건: 동일한 환경, 검증기, 목표를 사용하고 범위 지시만 바꾼다. 범위가 없는 조건은 원시 능력을, 범위가 있는 조건은 준수 능력을 측정한다.
- 두 단계 판정: 범위가 있는 조건에서 플래그를 얻으면 구조적으로 범위 위반이 발생했다고 볼 수 있다. 플래그를 얻지 못한 궤적은 에이전트형 심사기가 범위 밖 호출 여부를 확인한다.
- 심사기 보정: 사람이 호출 단위로 라벨링한 100개 궤적으로 심사기를 보정했다. 블라인드 감사에서는 확인된 위반 36건을 하나도 놓치지 않았으며, 관찰된 오류는 과잉 표시였다.
결과가 보여주는 것
하나의 하네스에서 평가한 8개 모델의 원시 능력은 12.2%에서 81.1%, 범위 준수율은 34.4%에서 86.7%까지 나타났다. 더 많은 과제를 풀 수 있다는 사실과 제약을 지킬 수 있다는 사실은 서로 다른 특성이라는 뜻이다. 따라서 공격 성공률만 보여주는 순위표는 실제 배포에서 문제가 될 행동을 가릴 수 있다.
에이전트형 심사기는 기계적 검증이 잡아내지 못한 위반 331건을 발견했다. 최종 플래그에 도달하지 못했더라도 중간에 금지된 호출을 했을 수 있기 때문이다. 또 Opus-4-8은 sonnet-4-6보다 원시 능력이 10%포인트 높았고, 범위 준수율은 35.6%포인트 높았다. 이 비교만으로 능력과 준수의 일반적인 관계를 단정할 수는 없지만, 두 요소를 함께 측정해야 할 이유는 분명해진다.
의미와 한계
ScopeBench의 핵심 기여는 ‘고객의 승인을 지켜라’라는 추상적 요구를 재현 가능한 실험으로 바꾼 데 있다. 환경과 목표를 고정하고 범위 지시만 변경하면, 자연어 경계가 도구 사용과 행동 선택에 미치는 영향을 비교할 수 있다.
다만 현재 공개된 기준은 30개 과제로 구성된 파일럿이며, 보안 에이전트의 전반적인 안전성을 대표한다고 보기는 어렵다. 지시문 표현, 도구 인터페이스, 심사기의 과잉 판정이 결과에 영향을 줄 수 있다. 그럼에도 벤치마크와 평가 코드, 2,160개의 ATIF 궤적이 공개되면서 재현과 확장을 위한 기반은 마련됐다. 실제 배포를 위해서는 공격 능력뿐 아니라, 가장 쉬운 경로가 승인되지 않았을 때 이를 거부할 수 있다는 증거도 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…