아티클 목록으로
강화학습

CriPO: 자기 증류로 Rubric 기반 RL의 사라진 학습 신호를 복원하다

약 3분 소요

도입

개방형 과제에서 대형 언어모델을 강화학습으로 개선할 때, 하나의 보상 점수만으로 답변 품질을 평가하기는 어렵습니다. Rubric-based RL은 문제를 여러 평가 기준으로 나누어 더 세밀한 피드백을 제공하려는 접근입니다. 예를 들어 정답성, 완전성, 특정 전문 분야의 요구사항을 별도 기준으로 다룰 수 있습니다.

하지만 이 논문은 기준이 많다고 해서 그 기준들이 모두 실제 학습 신호가 되는 것은 아니라고 지적합니다. 어떤 기준은 어떤 rollout에서도 만족되지 않아 최적화 신호가 전혀 생기지 않습니다. 또 어떤 기준은 일부 답변에서 만족되지만, 전체 보상을 하나의 스칼라 값으로 집계하는 과정에서 advantage가 비양수가 되어 유용한 행동이 오히려 강화되지 않을 수 있습니다. 저자들은 전자를 Unexplored Criteria, 후자를 Suppressed Criteria라고 부르며, 이를 함께 해결하기 위해 Criterion-Distilled Policy Optimization, 즉 CriPO를 제안합니다.

핵심 요점

  • 미탐색 기준은 피드백을 만들지 못한다: 샘플링된 답변 중 어느 것도 특정 rubric 항목을 만족하지 못하면, 기존 RL은 그 행동을 강화할 긍정 사례를 얻지 못합니다.
  • 외부 가이던스는 학습과 추론의 불일치를 낳을 수 있다: 일부 방법은 rollout 생성 중 rubric 정보를 외부에서 주입해 탐색을 돕습니다. 그러나 추론 시에는 같은 가이던스가 없기 때문에, 학습된 분포와 실제 생성 조건 사이에 차이가 생길 수 있습니다.
  • 억제된 기준은 더 은밀한 실패 모드다: 어떤 답변이 특정 기준을 만족하더라도 전체 보상이 낮으면, 그 기준과 관련된 token의 행동까지 약화될 수 있습니다. 논문은 학습 전반에서 57%가 넘는 샘플이 이 문제를 보였고, 샘플당 평균 1.8개의 억제된 기준이 있었다고 보고합니다.
  • CriPO는 자기 증류로 기준별 행동을 보존한다: 미탐색 기준에는 criterion-injection self-teacher를 구성하고 국소적인 forward-KL 손실을 사용해 누락된 행동을 정책에 주입합니다. 억제된 기준에는 counterfactual self-teacher를 활용해 음의 advantage를 가진 rollout 안에서 기준 관련 token을 찾고, 해당 token 수준 advantage를 양수로 뒤집습니다.

의미와 영향

CriPO의 핵심은 rubric 정보를 추론 시 외부 보조 장치로 남겨두지 않고, 학습 중 정책 내부에 흡수시키려는 점입니다. 이는 자동회귀 LLM에서 중요합니다. 생성 초반의 작은 오류가 이후 token 선택에 누적될 수 있기 때문입니다.

논문에 따르면 CriPO는 의학 및 과학 벤치마크에서 기존 Rubric-based RL 방법보다 일관되게 나은 성능을 보였고, 비슷한 성능에 도달하는 데 약 절반의 최적화 단계만 필요했습니다. 이는 좋은 평가 기준을 만드는 것만큼이나, 기준별 신호가 실제로 정책 업데이트에 전달되도록 설계하는 일이 중요함을 보여줍니다.

더 넓게 보면 이 연구는 스칼라 보상 집계의 한계를 드러냅니다. 다중 기준 rubric이 존재해도 각 기준의 국소적 증거가 학습 과정에서 보존되지 않으면, 모델은 다중 기준을 제대로 학습하지 못합니다. CriPO는 그 사라지는 신호를 자기 증류와 token 수준 보정으로 되살리려는 시도입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SAF-OPD: 강화학습과 온폴리시 증류를 안정적으로 결합하는 방법
강화학습
cctest.ai
강화학습

SAF-OPD: 강화학습과 온폴리시 증류를 안정적으로 결합하는 방법

SAF-OPD는 검증 가능한 보상 기반 강화학습과 온폴리시 증류를 단순히 고정 비율로 섞을 때 발생하는 불안정성을 다룬다. 교사 신호의 크기와 적용 시점을 조절해 탐색 능력을 보존하는 것이 핵심이다.

더 보기
CCTest · Blog
RLSVR: 개방형 LLM 과제를 자기 검증 가능한 강화학습 환경으로
강화학습
cctest.ai
강화학습

RLSVR: 개방형 LLM 과제를 자기 검증 가능한 강화학습 환경으로

이 논문은 수학·코딩처럼 정답 검증이 쉬운 영역에 강했던 RLVR을 개방형 생성 과제로 확장하려 한다. RLSVR은 과제를 변환해 환경 내부 규칙과 상호작용 결과에서 자동으로 보상을 얻는 방식을 제안한다.

더 보기