블랙박스를 열다: 프런티어 모델의 숨은 추론 추출하기
들어가며
프런티어 대규모 언어 모델의 빠른 성능 향상은 흔히 더 강한 추론 능력으로 설명된다. 하지만 폐쇄형 모델에서는 원래의 사고 연쇄를 확인할 수 없다. 외부에서 볼 수 있는 것은 최종 답변과 벤치마크 점수뿐이며, 모델이 실제로 어떤 과정을 거쳤는지는 추정에 머문다. 「Capable yet Parsimonious」 논문은 표준 API에 등록한 커스텀 도구를 통해 모델의 중간 추론 일부를 외부화하는 방법을 살펴본다.
연구 대상은 오픈소스 모델과 GPT-6 Astra, GPT-5.6 Sol, Claude Opus 4.8, Claude Sonnet 5 등 폐쇄형 프런티어 모델이다. 연구진은 외부로 나온 설명을 곧바로 진짜 사고라고 가정하지 않았다. 먼저 오픈 모델에서 추출된 추론을 네이티브 사고 연쇄와 비교했다. 모델이 답을 먼저 얻은 뒤 그럴듯한 설명을 만들어낼 가능성, 즉 사후 합리화를 배제할 수 없기 때문이다.
핵심 내용
- 추출된 추론은 행동 측면에서 유효했다. 경시 수학, 과학, 코드 생성에서 네이티브 추론과 부합하는 성능을 보였고, 추론을 사용하지 않는 기준선보다 크게 나았다.
- 모델마다 추론 구조가 다르다. 토큰 효율, 추론 단계의 유형, 유도된 추론 트리를 분석해 각 모델이 중간 과정을 확장하고 압축하는 방식을 비교했다.
- Astra는 방향성 있는 추론을 선호한다. 더 이른 시점에 올바른 경로를 선택하고 되돌아가는 과정이 적다. 기본 계산은 내부적으로 처리하고 중요한 단계만 외부에 드러내는 모습도 보였다.
- 짧은 기록은 확정적 증거가 아니다. 실제 역량, 테스트 데이터 암기, 사후 설명은 외부에서 모두 빠르게 정답에 도달한 것처럼 보일 수 있다.
의미와 한계
이 연구는 모델이 몇 문제를 맞혔는지에서 한 걸음 나아가, 관찰 가능한 추론을 어떻게 구성하는지에 주목하게 한다. 도구 호출로 유도한 추론 기록을 안정적으로 얻을 수 있다면, 모델이 언제 경로를 바꾸고 어떻게 오류에서 회복하는지, 정확도와 토큰 비용 사이에서 어떤 선택을 하는지를 분석할 수 있다. 이는 더 정교한 평가와 모델 모니터링, 안전 감사에 활용될 가능성이 있다.
다만 외부화된 텍스트는 모델이 생성한 행동의 결과이지, 완전하고 충실한 내부 계산 기록이라고 볼 수 없다. 앞으로는 다양한 과제와 적대적 조건에서 이 기록이 실패 원인을 실제로 드러내는지, 아니면 설득력 있는 설명만 제공하는지를 추가로 검증해야 한다. 저자들은 해당 방법을 OpenAI와 Anthropic에 공개했다고 밝혔다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…