정답률만으로 부족하다: LLM 평가에서 보정이 중요한 이유
들어가며
대규모 언어 모델을 평가할 때 연구자들은 보통 정확도, 승률, 벤치마크 점수에 먼저 주목한다. 그러나 평균적으로 얼마나 잘 답하는지만으로는 모델이 자신의 오류 가능성을 알고 있는지 판단하기 어렵다. 입장 논문인 《Calibration as a First-Class Criterion in LLM Evaluation》은 모델 보정(calibration)을 일부 불확실성 연구의 전문 주제가 아니라, LLM 평가의 기본 항목으로 다뤄야 한다고 주장한다.
보정은 모델이 표현하거나 암묵적으로 사용하는 확신도가 실제 정답 여부와 얼마나 일치하는지를 뜻한다. 보정이 잘 된 모델이라면 높은 확신을 부여한 답변일수록 더 자주 맞아야 하며, 근거가 부족할 때는 확신을 낮춰야 한다. 반대로 과신하는 모델은 틀린 답을 매우 단정적으로 제시해 사용자가 위험을 알아차리기 어렵게 만든다.
핵심 내용
- 측정법보다 도입 부족이 더 큰 문제다. NLP에는 이미 보정을 측정하는 여러 방법이 있다. 또한 많은 벤치마크가 모델의 확신도와 답변의 정답 여부라는 두 가지 정보를 제공한다. 정답이 명확한 작업에서는 평가 체계를 처음부터 다시 설계하지 않고도 보정 결과를 보고할 수 있다는 뜻이다.
- 배포 환경에서 오류의 위험이 커진다. 사용자는 불확실하다고 말하는 답보다 확신에 찬 답을 더 쉽게 받아들일 수 있다. 평균 점수만으로는 모델이 높은 확신을 보인 상황에서 얼마나 신뢰할 만한지, 언제 사람의 검토가 필요한지 충분히 알기 어렵다.
- 연구 파이프라인도 확신도에 의존한다. LLM-as-a-judge, 합성 데이터 생성, 능동학습은 다양한 방식으로 모델의 판단과 확신 신호를 사용한다. 이 신호가 보정됐는지 확인하지 않으면 낮은 품질의 데이터를 선택하거나 불안정한 평가를 신뢰할 수 있다.
- 개방형 생성에는 여전히 난제가 있다. 선택형 문제처럼 정답이 분명한 작업과 달리, 긴 답변과 창작, 복잡한 추론에서는 무엇을 정답으로 볼지 쉽게 합의하기 어렵다. 모델의 확신도를 어떤 단위로 추출하고 서로 비교할지도 아직 통일되지 않았다.
의미와 영향
이 논문은 새로운 보정 알고리즘을 제안하는 연구라기보다, 평가 관행을 바꾸자는 제안에 가깝다. 각 NLP 분야가 대표 성능 지표와 함께 보정 점수를 보고하면, 모델이 평균적으로 얼마나 잘하는지뿐 아니라 그 자신감이 실제로 유용한 정보인지도 확인할 수 있다.
능력과 신뢰성은 같은 개념이 아니다. 비슷한 성능을 보이는 두 모델이라도 불확실할 때 적절히 경고하는 능력은 다를 수 있다. 사람에게 판단을 넘겨야 하거나, 위험도에 따라 처리 우선순위를 정해야 하는 환경에서는 자신의 한계를 더 잘 드러내는 모델이 활용하기 쉽다. 또한 확률값이나 자연어로 표현된 자신감을 후속 시스템이 그대로 사용해도 되는지 판단하는 근거가 될 수 있다.
물론 보정만으로 정확성, 사실성, 편향, 개방형 답변의 품질을 모두 해결할 수는 없다. 보정은 기존 성능 지표를 대체하는 것이 아니라 보완하는 축이다. 이를 정기적으로 보고하면 LLM 평가는 “얼마나 자주 맞히는가”에서 한 걸음 더 나아가 “자신의 답이 얼마나 믿을 만한지 제대로 표현하는가”까지 다룰 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…