LLM 수학 추론의 약점은 계산보다 ‘발견’일 수 있다
들어가며
대규모 언어 모델은 점점 더 어려운 수학 문제를 풀고 있다. 그러나 정답을 냈다는 사실만으로 수학적 구조를 이해했다고 보기는 어렵다. 모델이 적절한 정리와 관계를 실제로 찾아낸 것인지, 익숙한 패턴을 조합한 것인지도 최종 정확도만으로는 구분하기 힘들다. 논문 ‘The Missing Primitive’는 이 차이를 추론 과정의 구성 요소로 나누어 살펴본다.
수학 추론을 네 능력으로 분해
연구진은 문제 해결에 재사용되는 수학적 구조, 지식, 연산을 수학적 프리미티브라고 정의하고, 이를 바탕으로 PRIM 벤치마크를 제안했다. PRIM은 다음 네 차원을 따로 평가한다.
- Discovery(발견): 적용할 정리, 관계, 풀이 구조를 찾아내는 능력
- Generation(생성): 발견한 구조를 수식이나 유효한 풀이 단계로 표현하는 능력
- Digestion(이해): 기존 유도 과정과 풀이를 읽고 흡수하는 능력
- Execution(실행): 계산, 변형, 후속 추론을 정확히 수행하는 능력
이 구분이 중요한 이유는 동일한 정답률을 보이는 모델도 능력 프로필이 크게 다를 수 있기 때문이다. 어떤 모델은 풀이 방향을 찾는 데 강하지만 계산에 약할 수 있고, 다른 모델은 풀이 구조가 주어졌을 때 실행을 잘할 수 있다. 연구는 수학적 프리미티브를 명시적으로 제공하면 모델 내부에 잠재해 있던 실행 능력이 상당 부분 드러난다고 보고한다. 일부 실패는 계산 능력 부족이 아니라 올바른 구조로 들어가는 방법을 찾지 못한 결과일 수 있다는 뜻이다.
가장 큰 병목은 발견
체계적인 진단에서 연구진은 Discovery를 수학 추론의 핵심 병목으로 지목한다. 필요한 공식이나 정리, 중간 구조가 주어지면 모델은 추론을 이어가는 경우가 많지만, 낯선 문제에서 어떤 구조를 적용해야 하는지 스스로 결정하는 상황에서는 취약해진다.
이는 긴 사고 과정을 추가하는 것만으로 모든 수학 오류를 해결하기 어려운 이유를 설명한다. 출발점의 해석이 틀리면 더 많은 단계가 올바른 해법이 아니라 잘못된 방향을 연장할 뿐이다. 따라서 성능 개선에는 후속 계산의 정교화뿐 아니라 처음 호출할 프리미티브를 선택하는 능력도 필요하다.
논문은 Discovery에 의해 제한된 실패가 특히 보완하기 쉽다는 분석도 제시한다. 모든 완성된 풀이를 동일하게 강화하기보다, 모델이 어떤 수학적 구조를 놓쳤는지 파악한 뒤 해당 구조를 발견하고 활용하도록 훈련하는 방식이 더 표적화된 접근이 될 수 있다.
진단에서 보완으로
이러한 관찰을 바탕으로 연구진은 ABSORB라는 ‘프리미티브 우선’ 자기 증류 프레임워크를 제안했다. 핵심은 수학적 프리미티브가 이끄는 추론을 선별해 학생 모델로 전달하는 것이다. 학생 모델은 최종 답뿐 아니라 어떤 구조를 선택해야 풀이가 가능한지도 학습하게 된다.
논문은 ABSORB가 여러 모델 규모와 도전적인 수학 벤치마크에서 기준 방법보다 일관되게 수학 추론을 개선했다고 보고한다. 다만 제공된 소재에는 구체적인 실험 수치가 없으므로, 여기서는 성능 수치보다 진단 체계와 후훈련 방향에 초점을 맞춰 해석하는 것이 적절하다.
의미와 한계
PRIM은 수학 능력을 단일 정답률이 아니라 구조 발견에서 실행으로 이어지는 능력 사슬로 바라보게 한다. 모델 개발자는 오류가 어느 단계에서 발생했는지 더 세밀하게 분석할 수 있고, 후훈련 설계자는 부족한 능력에 맞춘 선택적 보완을 검토할 수 있다.
물론 이 연구만으로 네 가지 구분이 모든 수학 과제에 보편적으로 적용된다고 말할 수는 없다. 모델이 수학을 ‘진정으로 이해한다’는 의미도 여전히 열린 문제다. 이 연구의 실질적인 가치는 막연한 수학 추론 능력을 측정하고 분석하며 개선할 수 있는 요소로 나누었다는 데 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…