아티클 목록으로
모델 평가

소형 언어 모델은 자신이 모르는 것을 알까

약 3분 소요

소형 언어 모델은 소비자용 하드웨어에서도 실행할 수 있고 비용과 지연 시간이 낮다는 장점이 있다. 하지만 실전 배포를 위해서는 한 가지 질문이 남는다. 소형 모델이 자신의 답변이 틀릴 가능성을 스스로 알아차릴 수 있을까?

arXiv에 공개된 이번 연구는 30억 개 미만의 파라미터를 가진 소형 언어 모델을 대상으로 이 문제를 분석했다. 단순히 모델의 평균 정확도를 비교한 것이 아니라, 모델 내부의 불확실성 신호가 맞는 답과 틀린 답을 구분하는지, 그리고 그 신호를 더 강한 모델로의 선택적 라우팅에 사용할 수 있는지를 살폈다.

연구의 핵심 결과

연구진은 토큰 수준 엔트로피, 시맨틱 엔트로피, 조기 종료, 불확실성 기반 전문가 모델 라우팅 등 7가지 접근법을 비교했다. 실험은 7개 모델 쌍과 5개 표준 자연어 이해 벤치마크에서 진행됐다.

  • 토큰 엔트로피는 신뢰할 만한 신호가 아니었다. 데이터셋과 모델 조합의 91%에서 평균 토큰 엔트로피가 정답인지 오답인지와 상관없이 거의 0에 가까웠다. 토큰 확률만으로는 소형 모델의 실제 확신 정도를 판단하기 어려웠다.
  • 의미 단위의 불확실성이 더 유용했다. 연구 방식은 답변을 여러 번 생성한 뒤 의미가 비슷한 답변끼리 묶고, 그 분포가 얼마나 퍼져 있는지 측정한다. 서로 다른 의미의 답변이 많이 나오면 모델이 해당 질문에 불확실할 가능성이 높다고 보는 것이다.
  • 불확실한 질문만 큰 모델로 보낼 수 있었다. 시맨틱 엔트로피가 높은 질문을 더 큰 전문가 모델에 라우팅하자 정확도가 최대 50%포인트 향상됐다. 이는 불확실성 추정이 단순한 평가 지표를 넘어 추론 자원 배분 도구가 될 수 있음을 보여준다.
  • 모델 계열보다 전문가 모델의 성능이 중요했다. SmolLM 360M에서 Phi-3.5-mini처럼 다른 계열로 라우팅했을 때 평균 개선 폭은 22.0%였다. 같은 계열 안에서 라우팅했을 때의 평균 개선 폭은 6.8%였다. 적어도 이번 비교에서는 구조적 호환성보다 전문가 모델의 능력이 더 큰 영향을 미쳤다.

의미와 한계

이번 결과는 소형 모델을 모든 질문에 혼자 답하는 시스템으로만 볼 필요가 없다는 점을 시사한다. 쉬운 요청은 로컬 소형 모델이 처리하고, 답변의 의미가 크게 갈리는 질문만 더 강한 모델로 넘기는 방식이다. 이렇게 하면 대부분의 요청에서는 비용과 지연 시간을 줄이면서, 어려운 사례에는 추가 연산을 집중할 수 있다.

다만 시맨틱 엔트로피를 계산하려면 여러 차례 생성하고 답변을 클러스터링해야 한다. 따라서 추가 비용이 실제 환경에서 얻는 정확도 향상을 상쇄하지 않는지는 작업과 하드웨어, 라우팅 정책에 따라 달라질 수 있다. 연구가 강조하는 핵심은 엔트로피 기반 방법의 목적이 단순한 연산량 절감이 아니라, 더 많은 계산이 필요한 곳을 똑똑하게 찾는 데 있다는 것이다.

arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AI가 AI 심사자를 학습시키면 과학적 판단은 어떻게 무너지는가
모델 평가
cctest.ai
모델 평가

AI가 AI 심사자를 학습시키면 과학적 판단은 어떻게 무너지는가

모델이 생성한 동료평가를 다음 세대 AI 심사자가 학습하면 평가 점수의 분포와 의미적 다양성이 축소될 수 있다는 연구가 나왔다. 연구진은 이를 ‘과학적 판단 붕괴’로 부르고 TrustReviewer를 통한 완화책을 제시했다.

더 보기