아티클 목록으로
강화학습

GRAFT, 이기종 모델의 추론 궤적으로 RLVR 학습을 확장하다

약 3분 소요

배경

검증 가능한 보상을 활용하는 강화학습, 즉 RLVR에서는 모델이 생성한 답이 맞는지 확인하고 그 결과를 학습 신호로 사용합니다. GRPO와 같은 방법은 하나의 문제에 대해 여러 답변을 생성한 뒤, 그룹 내 보상 차이를 바탕으로 어드밴티지를 계산해 정책을 업데이트합니다. 하지만 롤아웃 예산이 제한되면 모든 답변이 틀리는 그룹이 생길 수 있습니다. 이 경우 정답과 비교할 샘플이 없어, 보상 기반 정책 업데이트가 사실상 작동하지 않습니다.

논문 「Learning Beyond What You Sample」은 이 문제를 이기종 모델 간 궤적 교환으로 해결하는 GRAFT를 제안합니다. 서로 다른 모델은 같은 문제에서 동일한 약점을 보이지 않을 수 있습니다. 한 모델이 실패한 문제를 다른 모델이 이미 풀었을 가능성이 있다는 점에 착안한 것입니다. 따라서 GRAFT는 특정 강한 교사를 지정하는 대신, 여러 모델이 서로의 탐색 결과를 활용하도록 설계됩니다.

핵심 방식

  • 전부 실패한 그룹 대체: 한 모델의 샘플이 모두 실패하면, 같은 문제에서 동료 모델이 생성한 궤적을 가져와 학습에 활용합니다.
  • 성공과 실패를 모두 공유: 정답 응답만 전달하는 것이 아니라 오답 응답도 함께 교환하고, 응답을 생성한 동료 모델의 그룹에서 계산한 어드밴티지를 사용합니다. 이를 통해 단순한 정답 복사보다 풍부한 비교 신호를 유지합니다.
  • 오프폴리시 불일치 제어: 궤적을 만든 모델과 현재 업데이트되는 모델은 서로 다른 정책을 사용합니다. GRAFT는 시퀀스 수준의 호환성 가중치와 토큰 수준 중요도 비율 클리핑을 적용해 정책 분포 차이가 불안정한 업데이트로 이어지는 것을 제한합니다.
  • 저장된 궤적 재사용: 모델을 동시에 공동 학습하지 않고 미리 저장된 동료 궤적을 사용해도 상당한 개선을 유지할 수 있다고 보고합니다.

결과와 의미

저자들은 세 가지 이기종 모델 조합과 다섯 개의 수학 추론 벤치마크에서 GRAFT를 평가했습니다. 모델별 롤아웃 예산을 GRPO와 동일하게 맞춘 조건에서 두 모델 모두 일관되게 향상됐습니다. 평균 개선 폭은 2.1포인트였고, 모델 수준 평균 성능에서는 최대 4.5포인트의 향상이 나타났습니다. 저장된 동료 궤적을 사용하는 설정에서도 GRPO 대비 평균 1.8포인트의 개선이 유지됐습니다.

이 연구가 주는 핵심 시사점은 RLVR의 유용한 경험이 단일 모델이 직접 샘플링한 결과로 제한될 필요가 없다는 것입니다. 능력이 서로 다른 모델을 함께 사용하면 탐색 결과가 상호 보완되고, 한 모델이 놓친 성공 사례를 다른 모델이 학습에 제공할 수 있습니다. 다만 다른 정책에서 생성된 궤적을 무조건 섞어서는 안 됩니다. 모델 간 호환성을 평가하고 중요도 비율을 제한하는 과정이 학습 안정성에 중요합니다.

GRAFT는 실패 샘플로 인한 롤아웃 낭비를 줄이고, 궤적 캐시와 고정된 교사 없는 협력형 강화학습을 설계할 수 있는 한 가지 실용적 방향을 제시합니다. 추가 샘플을 계속 생성하는 대신, 이미 다른 모델이 찾아낸 경험을 재활용한다는 점이 이 접근법의 핵심입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LLM 강화학습의 학습·추론 불일치, CIS로 보정한다
강화학습
cctest.ai
강화학습

LLM 강화학습의 학습·추론 불일치, CIS로 보정한다

RLVR에서는 롤아웃을 생성하는 추론 엔진과 그래디언트를 계산하는 학습 엔진이 같은 토큰에 서로 다른 확률을 부여할 수 있습니다. 새 기법 CIS는 토큰 신뢰도를 반영한 중요도 샘플링으로 이 차이가 정책 업데이트에 미치는 영향을 줄입니다.

더 보기