SRD, 사후 경험을 RLVR의 사전 예측으로 바꾸다
들어가며
강화학습은 보통 에이전트가 환경과 상호작용을 끝낸 뒤 결과를 보상으로 바꿔 학습에 사용합니다. 하지만 여러 롤아웃을 그룹 안에서 비교하는 방식에서는 모든 궤적이 같은 보상을 받는 순간 차이가 사라지고, 업데이트 신호도 발생하지 않습니다. 모두 실패한 그룹이라도 실패한 도구 호출, 빠뜨린 지식, 잘못된 전략이 궤적에 드러날 수 있지만, 기존 학습에서는 이런 정보가 버려질 수 있습니다. 모두 성공한 경우에도 작업에 필요했던 조건은 여전히 유용한 학습 자료가 됩니다.
Self-Retrospection Distillation(SRD)은 이 문제를 ‘전망 학습’으로 다룹니다. 핵심은 완료 후 얻은 경험으로 행동 전의 예측을 감독하는 것입니다.
SRD의 작동 방식
- 에이전트는 상호작용을 시작하기 전에 자신이 만날 가능성이 있는 함정, 어려움, 부족한 지식을 예측합니다.
- 롤아웃이 끝나면 동일 정책의 그래디언트 정지 복사본이 전체 궤적을 읽고, 사전 예측이 실제 결과에 비춰 어떻게 수정되어야 하는지 평가합니다.
- SRD는 보조 증류 손실을 사용해 행동 전 예측과 사후에 얻은 토큰 단위 분포를 맞춥니다.
- 전망 결과는 훈련 목표로만 사용되며 추론 단계에서 별도로 생성할 필요가 없습니다. 따라서 GRPO, OPSD, RLSD에 추가할 수 있습니다.
이는 최종 보상을 다른 점수로 교체하는 방식이 아닙니다. 궤적 안에 있는 정보를 활용해 신용 할당을 개선하는 방식입니다. 보상이 같더라도 어떤 행동이 실패로 이어졌는지, 다음 실행 전에 무엇을 확인해야 하는지를 학습할 수 있습니다.
보고된 결과
저자들은 Qwen3.5-4B와 9B를 사용해 수학, 코드, 검색, ALFWorld, WebShop 등 10개 도구 통합·장기 과제를 평가했습니다. GRPO, OPSD, RLSD에 SRD를 결합했을 때 일관된 향상이 나타났으며, 최대 향상 폭은 24.2%포인트였습니다. 모델 규모에 따라 롤아웃 그룹의 37~98%가 보상 균일 그룹이었고, 보상 대비가 부족할수록 SRD의 장점이 두드러졌다고 저자들은 설명합니다.
특히 2B 설정에서는 전체 실패 그룹의 비율이 98%였습니다. 동일한 롤아웃 예산에서 GRPO 단독 훈련의 성공률은 0.0%였지만, GRPO에 SRD를 추가하자 60.6%에 도달했습니다. 또한 9B 모델의 일부 과제에서는 순수 자기 증류 방식인 OPSD가 훈련 전 모델보다 낮은 성능을 보였으나, SRD를 더하면 다시 훈련 전 기준을 넘어섰다고 보고됐습니다. 보지 못한 형식과 훨씬 긴 도구 호출 과정에서도 개선이 유지됐다는 설명도 제시됐습니다.
의미와 남은 질문
SRD의 의미는 실패 궤적을 단순히 쓸모없는 보상 데이터로 취급하지 않는 데 있습니다. 보상은 결과를 판단하고, 회고는 원인을 드러내며, 전망 목표는 그 원인을 다음 행동 전 준비로 바꿉니다. 긴 작업에서는 최종 보상 하나만으로 수많은 도구 호출 중 어디에서 문제가 발생했는지 찾기 어렵기 때문에, 이런 분리는 유용할 수 있습니다.
다만 제공된 자료만으로는 다른 환경과 더 큰 모델에 대한 일반화까지 판단하기 어렵습니다. 사후 평가 목표의 품질, 추가 정책 실행에 따른 계산 비용, 잘못된 회고가 잘못된 기대를 강화할 가능성은 논문과 코드로 더 검증해야 할 문제입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…