UndoBench: AI 에이전트는 작업 완료보다 안전한 복구를 평가받아야 한다
들어가며
기업용 소프트웨어를 조작하는 AI 에이전트에게 정상적인 상황에서 워크플로를 끝내는 능력은 첫 번째 관문일 뿐이다. 도구 호출이 시간 초과되거나 확인 응답이 사라지고, 실제 변경이 이미 발생했는지 알 수 없게 됐을 때 어떤 행동을 하는지가 더 중요할 수 있다. 상태 확인 없이 요청을 다시 보내면 결제, 레코드 생성, 권한 변경 등이 중복 실행될 위험이 있다.
UndoBench는 바로 이 문제를 겨냥한 평가 벤치마크다. 최종 성공 여부 하나로 에이전트 품질을 판단하지 않고, 정상적인 작업 역량과 장애 이후의 운영상 복구 역량을 분리해 측정한다.
핵심 결과
- 반사실적 페어 시험으로 장애의 영향을 분리한다. 8개 기업 영역에서 36개 기본 워크플로와 36개 장애 시나리오를 구성했다. 동일한 시드에서 정상 실행과 장애 주입 실행을 짝지었으며, 네트워크 수준의 효과 이력과 환경 상태 오라클을 이용해 실제 변화가 무엇이었는지 판정했다.
- 완료와 안전한 복구는 다르다. 확인 응답 손실을 다룬 실험에서는 12개 테스트 워크플로에 대해 5,760회 실행, 2,880쌍의 페어 시험을 수행했다. 명목상 작업 능력은 83.54%였지만 조건부 복구 성공률은 46.72%로 낮아졌다. 단순 재시도는 시험의 53.33%에서 중복 외부 효과를 발생시켰다.
- 장애 발생 단계가 결과를 좌우한다. 상태 변경 전에는 방법 간 성능 차이가 작았고, 능력을 보인 실행에서 중복 효과도 나타나지 않았다. 반면 부분 변경 중에는 단순 재시도, 호출별 멱등성, 권한 없는 저널링이 평가된 복합 워크플로에서 효과적으로 작동하지 않았다. 커밋 후 확인 전 단계에서는 검증 절차와 서버 측 멱등성이 더 안전한 결과를 보였다.
- 복구에는 추가 비용이 든다. 장애가 포함된 실행은 지연 시간이 29.3%, 완료 토큰이 10.5%, 도구 호출 횟수가 55.8% 증가했다. 최종적으로 성공하더라도 추가 비용과 운영 부담이 크면 실제 배포에는 부적합할 수 있다.
의미와 영향
UndoBench의 의미는 새로운 성공률 하나를 제시했다는 데 그치지 않는다. 기존 에이전트 벤치마크는 최종 상태가 맞는지 확인하는 데 집중하는 경우가 많아, 중간 과정에서 발생한 위험한 부작용을 놓칠 수 있다. 결제, 티켓, 재고, 접근 권한, 데이터 입력과 같은 업무에서는 눈에 보이는 실패보다 중복 실행이 더 큰 피해를 줄 수 있다.
따라서 운영 환경의 복구를 모델의 추론에만 맡겨서는 안 된다. 검증 가능한 상태 조회, 외부 효과 이력, 서버 측 멱등성 키, 에이전트의 권한 범위에 맞는 감사 체계가 필요하다. 평가 역시 최종 완료 여부뿐 아니라 중복 발생 여부, 복구에 추가된 시간·토큰·도구 호출량을 함께 측정해야 한다.
모델과 프레임워크 개발자에게 높은 정상 작업 성공률은 신뢰할 수 있는 도구 사용의 충분조건이 아니다. 배포 전 장애 주입과 단계별 복구 시험을 포함해야 실제 기업 환경의 안전 요구에 더 가까워질 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…