아티클 목록으로
모델 평가

APort Vault, AI 에이전트 결제 권한의 경계를 검증하다

약 3분 소요

들어가며

AI 에이전트가 결제 도구를 호출할 수 있게 되면 안전성은 단순히 “위험한 요청을 거부하는가”만으로 판단하기 어렵다. 실제로 중요한 지점은 돈이 이동하기 전에 수취인과 정책을 대조하고, 승인된 행동만 실행하는지 여부다. Hugging Face Daily Papers에 소개된 APort Vault는 이 결제 권한 경계를 측정하기 위한 벤치마크다.

핵심 결과

  • 실제 공격을 활용한 대규모 평가. 공개 CTF에서 사람이 작성한 공격 4,371건을 재생했으며, 8개 연구소의 14개 모델, 5개 정책 구성, 2개 재생 트랙을 포함했다. 한 트랙에는 Open Agent Passport 사양을 구현한 결정적 실행 전 검사를 적용했고, 다른 트랙에는 적용하지 않았다. 전체 평가 수는 225,964건이다.
  • 단일 점수로 축약하지 않았다. 각 평가에서 에이전트가 요청을 보냈는지, 결제가 실행됐는지, 정책이 호출을 거부했는지, 수취인이 승인됐는지를 따로 기록했다. 서로 다른 실패 원인을 하나의 성공률로 합치면 실제 취약 지점을 파악하기 어렵다는 판단이다.
  • 요청률은 모델보다 구성의 영향을 크게 받았다. 모델 단독 조건에서 Level 1부터 Level 4까지 요청률은 각각 10.9%, 3.0%, 0.1%, 79.4%였다. 다만 각 공격이 하나의 구성에만 속하므로 정책 효과와 공격 집단의 차이를 완전히 분리한 비교는 아니다.
  • Level 4에서 모델 간 행동이 비슷했다. 14개 모델 모두로 평가한 1,293개 Level 4 프롬프트의 요청률은 71.2%에서 84.3% 사이였다. 이 가운데 809개 프롬프트는 14개 모델 모두에서 요청을 유발했고, 해당 레벨에서 허용한 수취인으로 결제가 성공했다.
  • 가장 큰 차이는 권한 경계에서 나타났다. Level 2부터 Level 4까지 모델 단독 조건에서는 여권이 허용하지 않은 수취인으로의 송금이 76,842건 중 140건 발생했다. OAP 계층을 적용한 조건에서는 69,297건 중 0건이었다. 모델, 프롬프트, 트랙을 일치시킨 비교에서는 105건 대 0건이었다.

의미와 한계

OAP 계층이 모든 결제를 막아서 얻은 결과는 아니다. 계층 뒤에서도 25,370건의 결제가 실행됐고, 정책이 평가한 25,640건의 송금 호출 중 거부된 것은 187건이었다. 이 중 148건은 허용되지 않은 수취인과 관련됐다. 즉 결제 기능 전체를 끄기보다, 모델의 언어적 판단과 최종 권한 검사를 분리하는 설계가 가능하다는 점을 보여준다.

다만 0건의 위반이 모든 환경에서 안전하다는 증거는 아니다. 결과는 특정 공격 집합, 정책 레벨, 재생 환경에 한정되며 공격과 구성도 서로 연결돼 있다. 보고서는 이 0건의 결과가 790개 소스 세션에 걸쳐 나타났고, 세션 단위 위반률의 상한을 0.38%로 제시한다. APort Vault의 더 큰 의미는 평가 방법론에 있다. 결제형 에이전트는 요청 의도, 도구 실행, 정책 결정, 수취인 권한을 따로 측정해야 어떤 경계를 잘못 설정했는지 확인할 수 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
BI-Agent와 BI-Bench가 제시한 엔드투엔드 비즈니스 인텔리전스 자동화
모델 평가
cctest.ai
모델 평가

BI-Agent와 BI-Bench가 제시한 엔드투엔드 비즈니스 인텔리전스 자동화

새 연구에 따르면 최첨단 대규모 언어 모델도 실제에 가까운 BI 작업에서 정확도 50% 미만을 기록했습니다. 연구진은 데이터 검색부터 변환, 조인, 질의 응답까지 평가하는 BI-Bench와 도구 증강형 BI-Agent를 제안했습니다.

더 보기
CCTest · Blog
AI가 AI 심사자를 학습시키면 과학적 판단은 어떻게 무너지는가
모델 평가
cctest.ai
모델 평가

AI가 AI 심사자를 학습시키면 과학적 판단은 어떻게 무너지는가

모델이 생성한 동료평가를 다음 세대 AI 심사자가 학습하면 평가 점수의 분포와 의미적 다양성이 축소될 수 있다는 연구가 나왔다. 연구진은 이를 ‘과학적 판단 붕괴’로 부르고 TrustReviewer를 통한 완화책을 제시했다.

더 보기