HyperBrowseComp, 다국어·멀티모달 웹 브라우징 에이전트를 시험하다
들어가며
기존 웹 질의응답 벤치마크는 검색 결과에서 비교적 분명한 사실을 찾아내는 능력을 주로 평가한다. 그러나 실제 정보 탐색은 훨씬 복잡하다. 관련 단서가 여러 언어의 웹사이트, 동영상, 스캔 문서, 이미지, 지도에 흩어져 있을 수 있고, 최종 답을 얻으려면 여러 단계의 추론과 교차 검증이 필요하다. MBZUAI 연구진이 제안한 HyperBrowseComp는 이러한 현실적인 탐색 과정을 시험하기 위해 설계됐다.
핵심 내용
- 13개 언어 지원: 원어민 또는 높은 수준의 숙련자가 작성하고 사람이 검증한 423개 질문을 포함한다.
- 공개 웹 증거 탐색: 각 질문은 짧고 공개적으로 확인 가능한 답을 요구하지만, 답을 찾으려면 잘 드러나지 않는 자료와 여러 단계의 단서를 연결해야 한다.
- 이질적인 미디어 활용: 텍스트 웹페이지뿐 아니라 동영상, 스캔 문서, 이미지, 지도를 직접 살펴봐야 하는 과제가 포함될 수 있다.
- 암기만으로 푸는 문제를 줄임: 인터넷에 접속할 수 없는 모델로 문제를 평가해, 파라미터 지식만으로 해결 가능한 상대적으로 쉬운 문제를 걸러낸다.
- 공통 평가 절차 적용: 모델 제공업체의 검색 기능과 공통 외부 검색 하니스를 동일한 에이전트 프로토콜 아래에서 평가한다. 일부 질문에는 사람 평가도 실시해 모델의 성능과 노력 수준을 비교할 수 있도록 했다.
의미와 영향
HyperBrowseComp는 ‘검색할 수 있다’는 능력이 단일 기능이 아니라는 점을 보여준다. 에이전트는 질문을 이해하고, 적절한 검색 경로를 설계하며, 여러 언어의 자료를 찾고, 서로 다른 미디어를 해석하고, 증거의 관련성을 판단해야 한다. 나아가 서로 불완전하거나 충돌하는 자료를 다루면서 검증 가능한 결론에 도달할 때까지 탐색을 지속해야 한다. 키워드와 일치하는 페이지 하나를 찾는 것만으로는 충분하지 않다.
이 벤치마크는 앞으로의 에이전트 평가가 최종 답변의 정확도만으로 끝나서는 안 된다는 점도 시사한다. 검색 호출 횟수, 탐색 경로, 증거의 포괄성, 사람이 같은 문제를 해결하는 데 필요한 노력 등을 함께 보면 시스템의 실제 능력을 더 입체적으로 파악할 수 있다. 제공된 자료에는 구체적인 모델 점수가 포함되어 있지 않으므로, HyperBrowseComp는 현재 성능 순위라기보다 평가 프레임워크이자 연구 과제로 이해하는 편이 적절하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…