영국 AISI와 EvalEval, 대규모 모델 평가의 재현성을 높인다
들어가며
대규모 언어 모델의 벤치마크 점수는 연구 결론과 제품 평가, 정책 논의에 폭넓게 활용된다. 그러나 같은 벤치마크 이름을 사용하더라도 프롬프트, 추론 시 계산량, 재시도 방식, 피드백 제공 여부, 통계 집계법이 다를 수 있다. 따라서 겉으로 같은 능력을 측정하는 것처럼 보이는 점수도 실제로는 직접 비교하기 어려운 경우가 많다.
영국 AI 안전 연구소(AISI)와 EvalEval Coalition은 이 문제를 평가 기록 방식과 공개 인프라의 관점에서 다루고 있다. 이번 협력의 다음 단계에서 AISI는 일부 평가 방법과 결과를 EvalEval의 Evaluation Cards를 통해 공개한다. 여기에는 검증된 결과뿐 아니라 실험 설정과 해석에 필요한 맥락이 포함되며, AISI의 논문 How Inference Compute Shapes Frontier LLM Evaluation과 함께 제공된다.
핵심 내용
- 5개 벤치마크의 주요 실험 결과를 공개한다. HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro, Terminal-Bench 2.0이 대상이다.
- 6개 프런티어 모델을 다룬다. Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2, GPT-5.4의 결과가 포함된다. 관련 사이버 평가인 Cyber CTFs와 The Last Ones는 일부만 겹치는 별도의 모델 구성을 사용한다.
- 최종 점수 이상의 정보를 기록한다. Evaluation Cards는 벤치마크 메타데이터, 평가 실행 데이터, 모델 정보, 실험 설정을 공통 구조로 정리한다.
- 대화 단위 기록이 진단을 돕는다. 여러 번의 시도나 피드백이 있는 과제에서는 최종 정답률뿐 아니라 모델이 어떤 과정을 거쳐 결과에 도달했는지도 살펴볼 수 있다.
- Every Eval Ever 스키마를 활용한다. EEE는 논문, 리더보드, 저장소, 플랫폼에 흩어진 평가 결과에서 발생하는 정보 손실을 줄이려는 공통 형식이다.
평가 프로토콜이 중요한 이유
자료는 Humanity’s Last Exam을 통해 추론 시 계산량과 평가 프로토콜이 모델 성능에 어떤 차이를 만드는지 보여준다. 한 설정에서는 모델이 각 시도 뒤에 오라클로부터 정답 여부에 관한 피드백을 받는다. 사용할 수 있는 토큰이 늘어나면 모델은 추가 과제를 계속 해결할 수 있다.
핵심은 특정 프로토콜이 언제나 더 좋다는 뜻이 아니다. 모델이 재시도할 수 있는지, 피드백을 받는지, 얼마나 많은 추론을 허용받는지가 결과의 일부라는 의미다. 과제 버전, 추론 제한, 피드백 방식, 성공 결과의 집계 방식이 공개되지 않으면 보고서 간 차이가 모델 능력에서 비롯된 것인지 실험 설정에서 비롯된 것인지 판단하기 어렵다.
의미와 영향
이번 협력의 핵심은 새로운 순위표를 하나 더 만드는 데 있지 않다. 평가 결과와 이를 해석하는 데 필요한 정보를 함께 공개하는 인프라를 구축하는 데 있다. 검증된 결과와 설정을 함께 제공하면 연구자는 개별 연구를 더 자세히 확인하고, 다른 보고서와 조건을 고려해 비교할 수 있다. 기존 자료에 세부 정보가 부족한 경우에도 AISI의 공개 결과는 해석을 위한 기준점이 될 수 있다.
모델 개발자는 EEE를 활용해 검증된 평가 결과를 구조적으로 보고할 수 있다. 벤치마크 개발자는 벤치마크와 실행 데이터를 공유할 수 있으며, 평가·거버넌스·정책 연구자는 모델이나 벤치마크별로 Evaluation Cards를 탐색할 수 있다.
공통 형식이 도입된다고 해서 모든 평가가 즉시 재현되는 것은 아니다. 서로 다른 설정에서 얻은 점수가 자동으로 비교 가능해지는 것도 아니다. 다만 조건의 차이를 더 쉽게 발견하고, 단순히 점수를 모으는 수준을 넘어 점수가 만들어진 과정을 분석할 수 있다는 점에서 의미가 있다. 더 많은 평가 기관이 같은 방식을 채택한다면, 모델 능력과 안전성에 관한 논의도 보다 풍부한 근거를 바탕으로 진행될 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…