아티클 목록으로
강화학습

SRD, 사후 경험을 RLVR의 사전 예측으로 바꾸다

약 3분 소요

들어가며

강화학습은 보통 에이전트가 환경과 상호작용을 끝낸 뒤 결과를 보상으로 바꿔 학습에 사용합니다. 하지만 여러 롤아웃을 그룹 안에서 비교하는 방식에서는 모든 궤적이 같은 보상을 받는 순간 차이가 사라지고, 업데이트 신호도 발생하지 않습니다. 모두 실패한 그룹이라도 실패한 도구 호출, 빠뜨린 지식, 잘못된 전략이 궤적에 드러날 수 있지만, 기존 학습에서는 이런 정보가 버려질 수 있습니다. 모두 성공한 경우에도 작업에 필요했던 조건은 여전히 유용한 학습 자료가 됩니다.

Self-Retrospection Distillation(SRD)은 이 문제를 ‘전망 학습’으로 다룹니다. 핵심은 완료 후 얻은 경험으로 행동 전의 예측을 감독하는 것입니다.

SRD의 작동 방식

  • 에이전트는 상호작용을 시작하기 전에 자신이 만날 가능성이 있는 함정, 어려움, 부족한 지식을 예측합니다.
  • 롤아웃이 끝나면 동일 정책의 그래디언트 정지 복사본이 전체 궤적을 읽고, 사전 예측이 실제 결과에 비춰 어떻게 수정되어야 하는지 평가합니다.
  • SRD는 보조 증류 손실을 사용해 행동 전 예측과 사후에 얻은 토큰 단위 분포를 맞춥니다.
  • 전망 결과는 훈련 목표로만 사용되며 추론 단계에서 별도로 생성할 필요가 없습니다. 따라서 GRPO, OPSD, RLSD에 추가할 수 있습니다.

이는 최종 보상을 다른 점수로 교체하는 방식이 아닙니다. 궤적 안에 있는 정보를 활용해 신용 할당을 개선하는 방식입니다. 보상이 같더라도 어떤 행동이 실패로 이어졌는지, 다음 실행 전에 무엇을 확인해야 하는지를 학습할 수 있습니다.

보고된 결과

저자들은 Qwen3.5-4B와 9B를 사용해 수학, 코드, 검색, ALFWorld, WebShop 등 10개 도구 통합·장기 과제를 평가했습니다. GRPO, OPSD, RLSD에 SRD를 결합했을 때 일관된 향상이 나타났으며, 최대 향상 폭은 24.2%포인트였습니다. 모델 규모에 따라 롤아웃 그룹의 37~98%가 보상 균일 그룹이었고, 보상 대비가 부족할수록 SRD의 장점이 두드러졌다고 저자들은 설명합니다.

특히 2B 설정에서는 전체 실패 그룹의 비율이 98%였습니다. 동일한 롤아웃 예산에서 GRPO 단독 훈련의 성공률은 0.0%였지만, GRPO에 SRD를 추가하자 60.6%에 도달했습니다. 또한 9B 모델의 일부 과제에서는 순수 자기 증류 방식인 OPSD가 훈련 전 모델보다 낮은 성능을 보였으나, SRD를 더하면 다시 훈련 전 기준을 넘어섰다고 보고됐습니다. 보지 못한 형식과 훨씬 긴 도구 호출 과정에서도 개선이 유지됐다는 설명도 제시됐습니다.

의미와 남은 질문

SRD의 의미는 실패 궤적을 단순히 쓸모없는 보상 데이터로 취급하지 않는 데 있습니다. 보상은 결과를 판단하고, 회고는 원인을 드러내며, 전망 목표는 그 원인을 다음 행동 전 준비로 바꿉니다. 긴 작업에서는 최종 보상 하나만으로 수많은 도구 호출 중 어디에서 문제가 발생했는지 찾기 어렵기 때문에, 이런 분리는 유용할 수 있습니다.

다만 제공된 자료만으로는 다른 환경과 더 큰 모델에 대한 일반화까지 판단하기 어렵습니다. 사후 평가 목표의 품질, 추가 정책 실행에 따른 계산 비용, 잘못된 회고가 잘못된 기대를 강화할 가능성은 논문과 코드로 더 검증해야 할 문제입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
추론 모델은 왜 자기 학습으로 무너지는가: R-Quest의 문제 품질 관리
강화학습
cctest.ai
강화학습

추론 모델은 왜 자기 학습으로 무너지는가: R-Quest의 문제 품질 관리

추론 모델이 스스로 만든 문제는 학습에 활용될 수 있지만, 잘못된 문제와 수학적으로 반복되는 변형이 누적되면 성능이 붕괴할 수 있다. R-Quest는 유효성과 새로움 피드백으로 이 문제를 완화한다.

더 보기
CCTest · Blog
NeMo-DCR, 초대형 에이전트 RL 가중치 동기화를 약 35배 가속
강화학습
cctest.ai
강화학습

NeMo-DCR, 초대형 에이전트 RL 가중치 동기화를 약 35배 가속

NeMo-DCR은 학습 클러스터와 rollout 클러스터 사이에서 변경된 가중치만 전송하면서도 전체 체크포인트 로딩과 비트 단위로 동일한 결과를 보장합니다. 1조 파라미터 모델에서 변경률 3%를 적용한 테스트에서는 refit 시간이 87.5분에서 2.5분으로 줄었습니다.

더 보기