아티클 목록으로
강화학습

온라인 정책 증류의 스케일링: 작은 교사가 더 큰 추론 모델을 이끄는 방식

약 3분 소요

들어가며

강화학습은 대규모 언어 모델의 추론 능력을 크게 높일 수 있지만, 그 능력이 다른 모델로 자동 전달되는 것은 아닙니다. 교사와 학생의 규모, 초기 능력, 감독 신호를 제공하는 방식이 결과를 좌우합니다. 논문 「Scaling Properties of Same-Family On-Policy Distillation」은 온라인 정책 증류(OPD)를 통해 이 문제를 분석합니다. OPD에서는 학생이 먼저 자신의 응답을 생성하고, 이후 교사 정책으로부터 토큰 단위 reverse KL 감독을 받습니다.

연구진은 동일한 모델 계열 안에서 약한 교사에서 강한 학생으로의 전이, 같은 기반 모델 사이의 전이, 강한 교사에서 약한 학생으로의 전이를 비교했습니다. 프로젝트 페이지에는 25개 gold-score 궤적과 학습 재생, 전체 5×5 피크 성능 그리드가 제공됩니다. 또한 Qwen2.5 0.5B부터 14B까지를 포함하는 311개 체크포인트도 공개되어 후속 검증에 활용할 수 있습니다.

핵심 결과

  • 초기 학습에는 규칙적인 유용한 전이 구간이 존재합니다. 연구진은 학생 정책과 초기화 정책 사이 reverse KL divergence의 제곱근을 정책 변화량으로 사용했습니다. 초기 단계에서 검증 gold score는 이 변화량에 대해 대략 선형으로 증가했습니다. 일정 범위의 업데이트에서는 학습 성능의 흐름을 비교적 예측할 수 있다는 의미입니다.
  • 약한 교사도 더 강한 학생을 만들 수 있습니다. 관찰된 모든 약한 교사—강한 학생 조합에서 학생의 피크 gold score는 교사 자신의 점수를 넘어섰습니다. 교사는 학생의 성능 상한이라기보다, 유용한 행동 방향을 제공하는 신호로 작동할 수 있습니다.
  • 교사를 계속 키워도 효과는 무한히 늘지 않습니다. 교사 규모가 커질수록 학생의 피크 점수는 개선되지만, 이 효과는 교사 규모가 대체로 학생 규모에 도달할 때까지 나타났습니다. 그 이후의 파라미터 증가는 학생에게 비례적인 이득을 보장하지 않습니다.
  • 교사 점수만으로 감독 가치를 판단할 수 없습니다. gold score가 같은 수준인 교사들을 비교하면, 더 작은 교사가 더 효과적인 전이를 보이는 경우가 있었습니다. 따라서 교사 선정에는 최종 점수뿐 아니라 정책의 구조와 학생과의 규모 관계도 고려해야 합니다.
  • 여러 OPD 조건도 함께 분석했습니다. 연구진은 학생·교사 규모와 교사 점수에 따른 피크 성능 및 유용한 전이 구간의 기울기를 멱법칙으로 근사했습니다. OPD 변형, 약한 교사에서 강한 학생으로의 부트스트래핑, 온라인 감독의 정도도 추가로 살폈습니다.

의미와 한계

이 연구는 증류를 단순한 모델 압축이 아니라 교사 자원을 어떻게 배분할지 결정하는 스케일링 문제로 바라보게 합니다. 항상 가장 큰 교사를 선택하기보다 교사와 학생의 규모, 교사의 능력, 감독 신호의 효율을 함께 최적화해야 합니다. 먼저 비교적 작은 RL 전문가를 만든 뒤 이를 활용해 더 큰 학생 모델을 훈련하는 방식은 비용을 줄일 수 있는 실용적 경로가 될 수 있습니다.

또한 비슷한 벤치마크 점수를 가진 교사라도 학습 방향을 제공하는 방식은 다를 수 있습니다. 다만 결과는 특정 모델 계열과 OPD 설정에 기반합니다. 다른 아키텍처, 과제, 보상 체계, 모델 계열 간 전이에서도 같은 멱법칙이 유지되는지는 추가 연구가 필요합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LLM 강화학습의 학습·추론 불일치, CIS로 보정한다
강화학습
cctest.ai
강화학습

LLM 강화학습의 학습·추론 불일치, CIS로 보정한다

RLVR에서는 롤아웃을 생성하는 추론 엔진과 그래디언트를 계산하는 학습 엔진이 같은 토큰에 서로 다른 확률을 부여할 수 있습니다. 새 기법 CIS는 토큰 신뢰도를 반영한 중요도 샘플링으로 이 차이가 정책 업데이트에 미치는 영향을 줄입니다.

더 보기