크로스 토크나이저 정책 증류, 범위보다 감독 신뢰성이 중요
온폴리시 증류(On-Policy Distillation,OPD)는 학생 모델이 직접 생성한 응답을 학습 대상으로 삼고, 교사 모델의 예측 분포를 피드백으로 사용한다. 학생이 실제로 방문하는 생성 경로를 개선할 수 있다는 점에서 고정된 데이터셋을 모방하는 방식과 다르다. 하지만 교사와 학생이 서로 다른 토크나이저를 사용하면 두 모델의 예측을 바로 비교할 수 없다. 토큰 시퀀스의 위치뿐 아니라 어휘 수준에서도 대응 관계를 찾아야 한다.
이 논문은 정렬 범위를 넓히는 것이 실제 학습 성능을 높이는지 검토한다. 저자들은 수학 추론과 코드 생성 과제에서 토크나이저가 서로 다른 세 가지 교사·학생 조합을 평가했다. 결과는 감독 범위를 최대한 늘리는 것이 항상 올바른 전략은 아니라는 점을 보여준다.
핵심 결과는 다음과 같다.
- 엄격한 1대1 정렬 그룹은 교사와 학생의 어휘가 크게 달라도 학생 생성 토큰의 대부분을 포함했다.
- 증류 전 학생이 샘플링한 응답에서, 엄격하게 정렬된 위치의 공유 어휘는 교사와 학생 양쪽의 확률 질량 대부분을 보존했다.
- 각 위치에서 학생이 선택한 공유 어휘 Top-16에만 역 KL을 적용하면 전체 공유 어휘 OPD와 비슷한 정확도를 얻었고, 평가된 다른 크로스 토크나이저 기준선보다 좋은 결과를 보였다.
- 불일치 그룹의 로그 확률 스팬에 평균제곱오차 감독을 추가하면 감독 범위는 완전히 채워지지만 정확도는 오히려 하락했다.
추가 감독이 성능을 떨어뜨리는 이유도 분석됐다. 엄격한 손실만으로 학습한 체크포인트에서 불일치 스팬 손실의 그래디언트는 엄격한 손실의 그래디언트와 방향 일치가 약했으며, 일부 경우에는 반대 방향을 보였다. 또한 스팬 그래디언트의 상대적 크기는 점점 커졌다. 즉, 감독되지 않은 영역을 형식적으로 채우는 신호가 기존의 유용한 최적화 방향과 협력하지 않고 학습을 방해할 수 있다.
이 결과는 크로스 토크나이저 OPD의 설계 기준을 다시 생각하게 한다. 감독 범위만 측정할 것이 아니라, 해당 신호가 충분한 확률 질량을 담는지, 계산이 안정적인지, 기존 목표와 같은 방향의 그래디언트를 만드는지 확인해야 한다. 모든 불일치 스팬에 억지로 손실을 부여하기보다, 대응이 명확한 위치에서 작은 후보 집합을 활용하는 방식이 더 효율적일 가능성이 있다.
다만 실험은 제한된 모델 조합과 과제에 기반하므로 모든 환경에 동일한 결론을 적용할 수는 없다. 그럼에도 새로운 손실을 추가하기 전에 정렬 범위, 확률 질량, 그래디언트의 방향과 크기를 진단해야 한다는 실용적인 시사점을 제공한다. 향후 크로스 토크나이저 증류에서는 감독의 양보다 신뢰성이 더 중요한 최적화 기준이 될 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…