아티클 목록으로
모델 평가

AgentJudgeBench, 도구 호출 에이전트를 평가하는 LLM의 신뢰성 검증

약 3분 소요

들어가며

에이전트의 성능은 최종 답변이 그럴듯한지만으로 판단하기 어렵다. 어떤 도구를 선택했는지, 인자를 올바르게 전달했는지, 앞선 결과에 따른 의존 관계와 실행 순서를 지켰는지, 중간 오류에 적절히 대응했는지까지 살펴봐야 한다. 최근에는 다른 대규모 언어 모델을 평가자로 사용하는 방식이 널리 쓰이고 있지만, 복잡한 도구 호출 흐름에서 이런 평가가 얼마나 믿을 만한지는 충분히 검증되지 않았다.

AgentJudgeBench는 이 공백을 다루기 위한 벤치마크다. 일반적인 텍스트 선호도나 개방형 응답 평가와 달리, 방향성 비순환 그래프(DAG)로 표현되는 의존성 기반 도구 호출 워크플로에 초점을 맞춘다.

핵심 결과

  • 여러 조건을 함께 평가한다. 3,808개 인스턴스가 6가지 DAG 토폴로지와 3개 난도 등급으로 구성된다. 실험에는 서로 다른 규모의 5개 생성 모델과 6개 평가 모델이 사용됐다.
  • 난도가 높아질수록 일치도가 하락한다. 평가 결과와 프로그램 기반 기준 결과의 일치도는 작업 난도에 따라 꾸준히 낮아졌다. 정답 정보가 없는 조건에서는 정답 정보가 있는 조건보다 하락 속도가 약 1.5배 빨랐다.
  • 모델 크기만으로는 구조적 한계를 넘기 어렵다. 정답 정보가 없는 어려운 질의에서 6개 평가 모델의 성능은 77~82%라는 좁은 범위에 모였다. 더 큰 모델을 사용해도 작업 자체의 복잡성에서 비롯된 상한을 돌파하지 못했다.
  • 정답 정보가 항상 도움이 되지는 않는다. GPT-5.4의 일치도는 1.5%포인트, Gemini-2.5-Pro는 3.9%포인트 낮아졌다. 연구진은 평가자가 정답 정보에 지나치게 의존하는 앵커링 현상과 관련이 있을 수 있다고 설명한다.
  • 완화 전략의 효과는 제한적이다. 사고 연쇄 추론과 평가자 온도 조절은 거의 영향을 주지 않았다. 구조화된 평가 루브릭은 최대 6.5%포인트 향상시켰지만, 모든 생성 모델과 평가 모델 조합에서 동일한 효과를 내지는 않았다.

의미와 영향

이번 결과는 “더 큰 모델이 더 좋은 평가자”라는 가정을 재검토하게 한다. 도구 호출 에이전트의 평가 대상은 최종 출력이 아니라 도구 선택, 인자, 실행 순서, 의존성 충족 여부, 중간 상태를 포함한 전체 실행 기록이기 때문이다. 초반의 작은 오류가 뒤 단계로 전파될 수 있지만, 최종 답변만 본 평가자는 실제 실패 지점을 놓칠 수 있다.

따라서 실무에서는 도구 이름과 인자 형식, 의존성 충족, 단계별 결과, 최종 상태를 분리해 평가하고, 프로그램 기반 검증과 모델 기반 판정을 결합하는 방식이 필요하다. 정답 정보 역시 무조건적인 권위가 아니라 독립적인 검증을 돕는 참고 자료로 취급해야 한다.

AgentJudgeBench의 핵심 기여는 하나의 최강 평가 모델을 제시한 데 있지 않다. 평가 계층 자체도 특정 조건에서 취약할 수 있음을 보여준 데 있다. 에이전트 성능을 보고할 때는 성공률뿐 아니라 난도, 워크플로 구조, 정답 정보 제공 여부에 따라 평가 결과가 얼마나 안정적인지도 함께 공개해야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
1년간 쇼핑몰 운영으로 검증한 LLM 에이전트의 장기 자율성
모델 평가
cctest.ai
모델 평가

1년간 쇼핑몰 운영으로 검증한 LLM 에이전트의 장기 자율성

E-Commerce Bench는 LLM 에이전트가 365일 동안 조달 협상, 판매, 주문 처리, 반품, 현금흐름 관리를 수행하도록 설계된 평가 벤치마크입니다. 높은 수익과 종합적인 운영 역량은 서로 다를 수 있다는 결과를 보여줍니다.

더 보기
CCTest · Blog
RealSWE: 실제 사용자 요청으로 다시 보는 코딩 에이전트 평가
모델 평가
cctest.ai
모델 평가

RealSWE: 실제 사용자 요청으로 다시 보는 코딩 에이전트 평가

SWE-bench의 문제는 대체로 정형화되고 정보가 풍부하지만, 실제 사용자의 요청은 짧고 구어체이며 맥락이 부족한 경우가 많습니다. RealSWE는 현실적인 입력이 평균 해결률을 낮추고 모델 순위까지 바꿀 수 있음을 보여줍니다.

더 보기