아티클 목록으로
강화학습

추론 모델은 왜 자기 학습으로 무너지는가: R-Quest의 문제 품질 관리

약 3분 소요

들어가며

모델이 문제를 만들고, 직접 풀고, 그 결과로 다시 학습하는 자기 진화 방식은 추론 능력을 확장하는 유망한 접근이다. 그러나 이 순환이 계속된다고 해서 학습 데이터의 품질이 자동으로 좋아지는 것은 아니다. 반복이 진행될수록 모델은 답할 수 없는 문제를 만들거나, 이미 익숙한 문제를 조금 바꾼 형태로 되풀이할 수 있다.

논문 Questioning the Questions: Sustaining Self-Evolution in Reasoning Models는 자기 학습이 여러 라운드에 걸쳐 왜 약화되는지 분석하고, 이 문제를 해결하기 위한 R-Quest를 제안한다.

자기 생성 문제의 두 가지 결함

연구진은 성능 저하의 원인을 크게 두 가지로 정리한다.

  • 잘못된 문제의 증가. 조건이 부족하거나 논리적으로 모순되거나, 적절한 답을 가질 수 없는 문제가 반복 라운드에서 더 많이 나타난다. 여러 답이 일치하는지 확인하는 필터만으로는 문제 자체가 유효한지 판단할 수 없다. 연구는 답 일관성 필터가 학습 데이터에 남는 잘못된 문제의 비중을 오히려 높일 수 있다고 설명한다.
  • 표면적으로 드러나지 않는 수학 문제의 반복. 기존의 다양성 제어는 주로 단어와 문장 형태의 유사도에 의존한다. 따라서 표현은 달라도 같은 수학적 구조를 가진 문제를 새로운 문제로 오인할 수 있다. 이런 변형이 누적되면 모델이 접하는 실질적인 문제의 범위가 좁아진다.

결국 자기 진화의 병목은 솔버의 능력만이 아니다. 문제 생성기가 계속 어떤 학습 재료를 공급하는지도 매우 중요하다.

R-Quest의 접근법

R-Quest는 최종 답의 일치 여부만 보지 않고, 문제의 유효성과 새로움을 별도의 피드백 신호로 사용한다.

먼저 솔버가 잘못된 문제를 식별하고 거부하도록 학습한다. 이 판단은 문제 생성기의 보상을 조정하는 데 활용되고, 동시에 솔버를 학습시키는 데이터에서 문제 있는 사례를 걸러내는 데 사용된다. 잘못된 문제가 순환 과정에서 계속 증폭되는 것을 막는 구조다.

또한 어휘가 다른 중복 문제를 찾기 위해 동결된 기반 모델을 사용해 샘플링된 문제 쌍을 비교한다. 이 모델은 변하지 않는 기준점 역할을 하며, 두 문제가 서로 다른 표현으로 같은 수학적 과제를 나타내는지 판단하는 새로움 피드백을 제공한다.

실험 결과와 의미

논문에 따르면 R-Quest는 두 모델 계열을 대상으로 수학적 추론, 일반 영역 추론, 코드 생성을 포함한 12개 벤치마크에서 가장 높은 평균 성능을 기록했다. 특히 10회의 자기 진화 라운드 동안 성능 향상을 안정적으로 유지했고, 마지막 라운드에서 최고점에 도달했다. R-Zero와 비교하면 최종 결과가 17.32점 높았다.

이 연구의 핵심 메시지는 답이 일치한다는 사실만으로 자기 생성 데이터를 신뢰할 수 없다는 것이다. 문제 자체가 성립하는지, 그리고 이전과 다른 능력 도전을 제공하는지를 함께 확인해야 한다. 유효성 피드백은 오류가 있는 감독 신호의 확산을 줄이고, 새로움 피드백은 학습 과정이 익숙한 문제 유형으로 수축하는 것을 막는다.

따라서 자기 진화는 학습 알고리즘의 문제가 아니라 데이터 품질 관리의 문제이기도 하다. 앞으로는 난이도, 정보 획득량, 분야를 넘나드는 의미적 중복까지 안정적으로 측정하는 방법이 장기적인 자기 개선의 핵심 과제가 될 가능성이 크다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SRD, 사후 경험을 RLVR의 사전 예측으로 바꾸다
강화학습
cctest.ai
강화학습

SRD, 사후 경험을 RLVR의 사전 예측으로 바꾸다

Self-Retrospection Distillation(SRD)은 에이전트가 작업을 마친 뒤 얻은 궤적을 활용해 행동 전에 예상해야 할 함정과 어려움을 학습시킵니다. 그룹 내 보상이 모두 같아지는 강화학습에서도 궤적에 남은 정보를 학습 신호로 되살리는 접근입니다.

더 보기
CCTest · Blog
NeMo-DCR, 초대형 에이전트 RL 가중치 동기화를 약 35배 가속
강화학습
cctest.ai
강화학습

NeMo-DCR, 초대형 에이전트 RL 가중치 동기화를 약 35배 가속

NeMo-DCR은 학습 클러스터와 rollout 클러스터 사이에서 변경된 가중치만 전송하면서도 전체 체크포인트 로딩과 비트 단위로 동일한 결과를 보장합니다. 1조 파라미터 모델에서 변경률 3%를 적용한 테스트에서는 refit 시간이 87.5분에서 2.5분으로 줄었습니다.

더 보기