소형 언어 모델은 자신이 모르는 것을 알까
소형 언어 모델은 소비자용 하드웨어에서도 실행할 수 있고 비용과 지연 시간이 낮다는 장점이 있다. 하지만 실전 배포를 위해서는 한 가지 질문이 남는다. 소형 모델이 자신의 답변이 틀릴 가능성을 스스로 알아차릴 수 있을까?
arXiv에 공개된 이번 연구는 30억 개 미만의 파라미터를 가진 소형 언어 모델을 대상으로 이 문제를 분석했다. 단순히 모델의 평균 정확도를 비교한 것이 아니라, 모델 내부의 불확실성 신호가 맞는 답과 틀린 답을 구분하는지, 그리고 그 신호를 더 강한 모델로의 선택적 라우팅에 사용할 수 있는지를 살폈다.
연구의 핵심 결과
연구진은 토큰 수준 엔트로피, 시맨틱 엔트로피, 조기 종료, 불확실성 기반 전문가 모델 라우팅 등 7가지 접근법을 비교했다. 실험은 7개 모델 쌍과 5개 표준 자연어 이해 벤치마크에서 진행됐다.
- 토큰 엔트로피는 신뢰할 만한 신호가 아니었다. 데이터셋과 모델 조합의 91%에서 평균 토큰 엔트로피가 정답인지 오답인지와 상관없이 거의 0에 가까웠다. 토큰 확률만으로는 소형 모델의 실제 확신 정도를 판단하기 어려웠다.
- 의미 단위의 불확실성이 더 유용했다. 연구 방식은 답변을 여러 번 생성한 뒤 의미가 비슷한 답변끼리 묶고, 그 분포가 얼마나 퍼져 있는지 측정한다. 서로 다른 의미의 답변이 많이 나오면 모델이 해당 질문에 불확실할 가능성이 높다고 보는 것이다.
- 불확실한 질문만 큰 모델로 보낼 수 있었다. 시맨틱 엔트로피가 높은 질문을 더 큰 전문가 모델에 라우팅하자 정확도가 최대 50%포인트 향상됐다. 이는 불확실성 추정이 단순한 평가 지표를 넘어 추론 자원 배분 도구가 될 수 있음을 보여준다.
- 모델 계열보다 전문가 모델의 성능이 중요했다. SmolLM 360M에서 Phi-3.5-mini처럼 다른 계열로 라우팅했을 때 평균 개선 폭은 22.0%였다. 같은 계열 안에서 라우팅했을 때의 평균 개선 폭은 6.8%였다. 적어도 이번 비교에서는 구조적 호환성보다 전문가 모델의 능력이 더 큰 영향을 미쳤다.
의미와 한계
이번 결과는 소형 모델을 모든 질문에 혼자 답하는 시스템으로만 볼 필요가 없다는 점을 시사한다. 쉬운 요청은 로컬 소형 모델이 처리하고, 답변의 의미가 크게 갈리는 질문만 더 강한 모델로 넘기는 방식이다. 이렇게 하면 대부분의 요청에서는 비용과 지연 시간을 줄이면서, 어려운 사례에는 추가 연산을 집중할 수 있다.
다만 시맨틱 엔트로피를 계산하려면 여러 차례 생성하고 답변을 클러스터링해야 한다. 따라서 추가 비용이 실제 환경에서 얻는 정확도 향상을 상쇄하지 않는지는 작업과 하드웨어, 라우팅 정책에 따라 달라질 수 있다. 연구가 강조하는 핵심은 엔트로피 기반 방법의 목적이 단순한 연산량 절감이 아니라, 더 많은 계산이 필요한 곳을 똑똑하게 찾는 데 있다는 것이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…