Harbor, 80개 이상 에이전트 벤치마크를 하나로 묶다
들어가며
언어 모델이 웹 탐색, 터미널 조작, 도구 호출, 다단계 작업을 수행하기 시작하면서 에이전트 평가의 기준도 달라지고 있습니다. 이제는 답변 하나의 정확성뿐 아니라, 모델이 실제 환경에서 여러 단계를 거쳐 목표를 완수할 수 있는지를 확인해야 합니다. 그러나 기존 에이전트 벤치마크는 서로 다른 환경, 인터페이스, 실행 하네스를 사용하는 경우가 많아 통합 비용이 높고 결과를 공정하게 비교하기도 어렵습니다.
arXiv에 공개된 새 연구는 이런 문제를 인프라와 평가 데이터셋 양쪽에서 다루기 위해 Harbor Adapters와 Harbor-Index를 제안했습니다.
핵심 내용
- 공통 어댑터 제공. Harbor Adapters는 80개가 넘는 에이전트 벤치마크를 하나의 평가 인프라에 연결합니다. 연구진은 코드 리뷰와 패리티 실험을 통해 이식 이후에도 원래 과제의 의미와 난도가 유지되는지 검증했습니다.
- 대규모 교차 평가. 서로 다른 능력 수준의 8개 모델을 54개 벤치마크에서 평가했습니다. 모든 모델은 Terminus-2와 세 가지 네이티브 하네스 중 하나를 사용해 실행됐습니다. 이를 통해 모델 자체의 능력뿐 아니라 실행 프레임워크의 영향과 실패 원인도 살펴볼 수 있습니다.
- 엄선된 82개 과제. Harbor-Index는 29개 벤치마크에서 어렵고 다양한 82개 과제를 골라 구성했습니다. 난도 필터링, AI와 사람의 감사, 문제 발견 뒤 수정하는 반복 절차를 적용해 평가 비용을 낮추면서도 폭넓은 도전 과제를 유지하려 했습니다.
- 여전히 낮은 통과율. 평가된 어떤 모델-하네스 조합도 통과율 30%를 넘지 못했습니다. 가장 높은 결과는 GPT-5.5와 Codex 조합의 28.0%였습니다. 이는 복잡한 환경에서 계획을 세우고 도구를 연속적으로 사용하는 일이 강력한 시스템에도 여전히 어렵다는 점을 보여줍니다.
의미와 영향
Harbor의 핵심 가치는 새로운 순위표를 추가하는 데만 있지 않습니다. 에이전트 평가의 구현 계층을 표준화해, 실패가 모델의 추론 능력 때문인지, 하네스와 도구 통합 또는 환경 설정 때문인지 구분하기 쉽게 만듭니다. 개발자에게 Harbor-Index는 전체 벤치마크를 매번 실행하지 않고도 모델이나 에이전트 스택을 변경한 뒤 성능 변화를 확인할 수 있는 비교적 저렴한 회귀 테스트로 활용될 수 있습니다.
다만 어댑터가 모든 평가 편향을 없애는 것은 아닙니다. 벤치마크마다 목표, 환경 제약, 성공 판정 방식이 다르고, 82개 과제만으로 실제 업무 전체를 대표할 수도 없습니다. 따라서 Harbor는 에이전트 지능을 단일 수치로 확정하는 도구라기보다, 재현 가능한 평가를 위한 기반이자 보완적인 테스트 세트로 보는 편이 타당합니다. 어댑터와 결과, 분석, Harbor-Index를 공개한 점은 커뮤니티가 이를 재검증하고 확장할 수 있는 출발점을 제공합니다.
출처: arXiv
댓글
로그인 상태 확인 중…
댓글 불러오는 중…