GRAFT, 이기종 모델의 추론 궤적으로 RLVR 학습을 확장하다
배경
검증 가능한 보상을 활용하는 강화학습, 즉 RLVR에서는 모델이 생성한 답이 맞는지 확인하고 그 결과를 학습 신호로 사용합니다. GRPO와 같은 방법은 하나의 문제에 대해 여러 답변을 생성한 뒤, 그룹 내 보상 차이를 바탕으로 어드밴티지를 계산해 정책을 업데이트합니다. 하지만 롤아웃 예산이 제한되면 모든 답변이 틀리는 그룹이 생길 수 있습니다. 이 경우 정답과 비교할 샘플이 없어, 보상 기반 정책 업데이트가 사실상 작동하지 않습니다.
논문 「Learning Beyond What You Sample」은 이 문제를 이기종 모델 간 궤적 교환으로 해결하는 GRAFT를 제안합니다. 서로 다른 모델은 같은 문제에서 동일한 약점을 보이지 않을 수 있습니다. 한 모델이 실패한 문제를 다른 모델이 이미 풀었을 가능성이 있다는 점에 착안한 것입니다. 따라서 GRAFT는 특정 강한 교사를 지정하는 대신, 여러 모델이 서로의 탐색 결과를 활용하도록 설계됩니다.
핵심 방식
- 전부 실패한 그룹 대체: 한 모델의 샘플이 모두 실패하면, 같은 문제에서 동료 모델이 생성한 궤적을 가져와 학습에 활용합니다.
- 성공과 실패를 모두 공유: 정답 응답만 전달하는 것이 아니라 오답 응답도 함께 교환하고, 응답을 생성한 동료 모델의 그룹에서 계산한 어드밴티지를 사용합니다. 이를 통해 단순한 정답 복사보다 풍부한 비교 신호를 유지합니다.
- 오프폴리시 불일치 제어: 궤적을 만든 모델과 현재 업데이트되는 모델은 서로 다른 정책을 사용합니다. GRAFT는 시퀀스 수준의 호환성 가중치와 토큰 수준 중요도 비율 클리핑을 적용해 정책 분포 차이가 불안정한 업데이트로 이어지는 것을 제한합니다.
- 저장된 궤적 재사용: 모델을 동시에 공동 학습하지 않고 미리 저장된 동료 궤적을 사용해도 상당한 개선을 유지할 수 있다고 보고합니다.
결과와 의미
저자들은 세 가지 이기종 모델 조합과 다섯 개의 수학 추론 벤치마크에서 GRAFT를 평가했습니다. 모델별 롤아웃 예산을 GRPO와 동일하게 맞춘 조건에서 두 모델 모두 일관되게 향상됐습니다. 평균 개선 폭은 2.1포인트였고, 모델 수준 평균 성능에서는 최대 4.5포인트의 향상이 나타났습니다. 저장된 동료 궤적을 사용하는 설정에서도 GRPO 대비 평균 1.8포인트의 개선이 유지됐습니다.
이 연구가 주는 핵심 시사점은 RLVR의 유용한 경험이 단일 모델이 직접 샘플링한 결과로 제한될 필요가 없다는 것입니다. 능력이 서로 다른 모델을 함께 사용하면 탐색 결과가 상호 보완되고, 한 모델이 놓친 성공 사례를 다른 모델이 학습에 제공할 수 있습니다. 다만 다른 정책에서 생성된 궤적을 무조건 섞어서는 안 됩니다. 모델 간 호환성을 평가하고 중요도 비율을 제한하는 과정이 학습 안정성에 중요합니다.
GRAFT는 실패 샘플로 인한 롤아웃 낭비를 줄이고, 궤적 캐시와 고정된 교사 없는 협력형 강화학습을 설계할 수 있는 한 가지 실용적 방향을 제시합니다. 추가 샘플을 계속 생성하는 대신, 이미 다른 모델이 찾아낸 경험을 재활용한다는 점이 이 접근법의 핵심입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…