아티클 목록으로
모델 평가

AI 에이전트는 ‘완료’라는데 데이터베이스는 다르게 말한다

약 3분 소요

들어가며

AI 에이전트가 적절한 도구를 호출하고 매끄러운 답변을 생성해도 업무를 제대로 끝냈다고 볼 수는 없습니다. Microsoft와 Hugging Face가 공개한 ThinkingBox는 평가의 초점을 에이전트가 한 말에서 실제 시스템에 남긴 결과로 옮깁니다. 에이전트를 격리된 MCP 도구 세션에서 실행한 뒤 백엔드의 최종 상태와 발생한 부작용을 직접 검사합니다.

성공처럼 보이는 실패

소재에 등장하는 사례는 배송센터에서 15일 동안 지연된 고가 주방가전 문의입니다. 에이전트는 주문과 배송 추적, 고객 프로필, 환불 정책을 확인하고 티켓을 생성해 경과를 기록했습니다. 고객이 배송 지연 보상 대상이 아니라는 판단도 맞았습니다.

하지만 운송사의 예외 처리는 아직 끝나지 않았습니다. 따라서 티켓은 보류 상태로 남아야 했지만, 에이전트는 이를 해결됨으로 닫았습니다. 최종 답변 역시 고객이 실제로 물은 내용에 충분히 답하지 못했습니다. 도구 호출 기록만 확인하면 정상처럼 보이지만, 데이터베이스 상태를 검사하면 실패입니다.

핵심 포인트

  • 실제 결과를 확인한다. 필요한 필드가 올바른 값인지, 필수 부작용이 발생했는지, 의도하지 않은 추가 변경이 있었는지를 실행 가능한 검사로 판단합니다.
  • 한 번의 성공은 신뢰성이 아니다. 507개 업무 작업을 동일한 초기 백엔드에서 각각 20회 실행하고, pass@1, pass@20, 20회 모두 성공한 작업 수를 구분해 보고합니다.
  • 정상 종료가 실패를 가릴 수 있다. 121,680회의 유효한 시험 중 79,853회가 실행 가능한 검사에 실패했습니다. 이 실패 중 67.24%는 정상 종료했고 상태 변경 도구를 호출했으며 최종 도구 오류도 보고하지 않았습니다.
  • 범위와 일관성은 다르다. Kimi-K3는 507개 중 476개 작업에서 한 번 이상 성공했지만, 20회 모두 통과한 작업은 68개였습니다. Claude Opus 5는 한 번 이상 성공한 작업 수는 더 적었지만 241개 작업에서 모든 반복을 통과했습니다.

의미와 영향

이 결과는 기업용 에이전트를 평가하는 방식의 약점을 보여줍니다. 높은 pass@1은 모델이 작업을 수행할 수 있다는 뜻이지, 다음 실행에서도 올바른 값을 기록한다는 보장은 아닙니다. 고객지원, 보험, 은행, 여행 시스템에서는 잘못된 상태값이나 업데이트 누락, 불필요한 부작용이 부정확한 문장보다 더 큰 문제를 일으킬 수 있습니다.

따라서 실제 도입 전에는 백엔드의 최종 조건을 자동으로 검증하고, 최소한 작업을 한 번이라도 해결하는 범위, 단일 실행 성공률, 반복 실행의 안정성을 나눠 봐야 합니다. ThinkingBox의 핵심 가치는 새로운 순위표 자체보다, 에이전트의 실행 궤적은 주장일 뿐이며 최종 시스템 상태가 증거라는 사실을 평가 설계에 반영했다는 데 있습니다.

출처: Hugging Face Blog

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PhysVista, 인식·추론·평가 루프로 VLM의 물리 지능을 검증
모델 평가
cctest.ai
모델 평가

PhysVista, 인식·추론·평가 루프로 VLM의 물리 지능을 검증

PhysVista는 비전-언어 모델이 영상의 표면적 내용을 인식하는 데 그치지 않고 물리적 일관성을 이해하는지 평가하는 벤치마크입니다. 실제 영상과 AI 생성 영상을 대상으로 물리 상태 인식, 동역학 추론, 물리적 개연성 판단을 하나의 루프로 검증합니다.

더 보기
CCTest · Blog
OpenTumorBoard, 암 다학제 진료에서 AI의 협업 추론을 시험하다
모델 평가
cctest.ai
모델 평가

OpenTumorBoard, 암 다학제 진료에서 AI의 협업 추론을 시험하다

OpenTumorBoard는 공개된 종양 다학제 회의 기록을 활용해 전문의 답변과 전체 회의 시뮬레이션을 평가하는 벤치마크입니다. 최신 모델도 전문가의 답변과 실제 위원회 결론을 일관되게 재현하는 데는 상당한 한계를 보였습니다.

더 보기