FlavourBench, 실행 가능한 요리 정답으로 LLM을 평가하다
들어가며
대규모 언어 모델 벤치마크는 대개 사람의 선호도 평가, 다른 모델의 판정, 또는 엄격한 정답 키에 의존한다. 사람의 평가는 주관성이 개입될 수 있고, 모델 심판은 별도의 편향을 가져올 수 있다. 반대로 정확히 일치하는 답만 인정하는 방식은 답변의 형태가 다양한 개방형 과제에 적합하지 않다. FlavourBench는 요리 조합이라는 제한된 영역을 활용해, 개방형 평가를 실행 가능한 기준과 연결하는 방법을 제시한다.
평가 방식
각 과제는 8개의 식재료를 제시하고, 모델에게 그중 3개를 선택하도록 요구한다. 가능한 조합은 모두 56개다. Epicure라는 버전 관리형 요리 시스템은 모델이 답변하기 전에 이 56개 포트폴리오를 모두 채점한다. 따라서 평가자는 응답을 본 뒤 임의로 그럴듯함을 판단하는 대신, 미리 고정된 점수 맵과 모델의 선택을 대조할 수 있다.
핵심 세트는 534개 과제로 구성되며, 식재료 대체, 풍미 조합, 제약 조건이 있는 구성 문제를 포함한다. 연구진은 27개 프런티어 모델 엔드포인트를 평가했다. 순위에 포함된 모든 모델은 각 패널과 모델 패밀리마다 유효 응답을 89개씩 갖도록 맞췄다. 모델별 누락 응답 차이가 순위에 미치는 영향을 줄이기 위한 조치다. 전체 평가 규모는 14,418개의 모델-과제 셀이며, 최종 FlavourBench 점수는 고정된 과제 점수를 패밀리별로 동일하게 평균해 계산한다.
불확실성도 별도로 분석했다. 독립적으로 구성한 두 패널은 점수 기준 상관계수 0.89, 순위 기준 상관계수 0.80을 기록했다. 연구진은 동시 95% 점수 구간을 계산하기 위해 50,000회의 앵커 클러스터 부트스트랩을 수행했다. 351개 모델 쌍 비교에는 100,000회의 부호 뒤집기 추출을 적용했고, 다중 비교 문제는 Holm 보정으로 통제했다.
결과와 의미
Grok 4.6은 65.1의 점 추정치로 가장 높은 결과를 보였으며, 동시 95% 신뢰구간은 61.0에서 69.2였다. 그러나 이것이 모든 모델 사이에 확실한 성능 차이가 있다는 뜻은 아니다. 351개 쌍 비교 중 통계적 절차로 차이가 확인된 쌍은 101개에 그쳤다. 즉, 리더보드의 순위와 두 모델의 차이가 실제로 구분 가능한지는 별도로 해석해야 한다.
FlavourBench의 더 큰 의미는 요리 분야 순위가 아니라 평가 설계에 있다. 후보 공간을 미리 정의하고, 실행 가능한 시스템으로 채점하며, 유효 응답 수를 통일하고, 통계 절차와 재현 자료를 공개하면 개방형 과제도 더 감사 가능한 형태로 만들 수 있다는 점이다. 다만 결과는 Epicure의 요리 표현 방식과 과제 설계에 종속되며, 일반 추론 능력이나 실제 요리 실력을 직접 측정하는 지표는 아니다. 다른 분야에 적용하려면 신뢰할 수 있는 실행 평가기와 명확한 후보 공간이 필요하다.
공개 범위도 주목할 만하다. 프로젝트는 프롬프트, 전체 포트폴리오 점수 맵, 원시 응답, 정확한 라우트, 콘텐츠 해시, 오프라인 검증기를 제공한다. 외부 연구자는 이를 이용해 결과를 재구성하고 벤치마크의 전제를 직접 점검할 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…