BPO, 비평자 없이 검증 가능한 보상으로 LLM을 학습하다
들어가며
대규모 언어 모델의 추론 능력을 높이는 방법으로 검증 가능한 보상을 활용한 강화학습(RLVR)이 주목받고 있습니다. 수학 문제처럼 완성된 답변의 정오를 확인할 수 있는 작업에서는 신뢰할 수 있는 보상이 존재하지만, 그 보상이 생성 마지막에만 주어진다는 문제가 있습니다. 긴 토큰 시퀀스의 각 선택에 종료 보상을 어떻게 반영할지는 정책 최적화의 핵심 과제입니다.
Bellman Policy Optimization(BPO)은 이 문제를 비평자 모델 없이 다루는 방법입니다. 정책 미러 하강(Policy Mirror Descent, PMD)에서 출발해 벨만 방정식을 적용하고, 종료 보상을 받는 자기회귀 생성의 학습 목표를 전체 궤적 수준으로 다시 표현합니다.
핵심 내용
- 중간 상태 가치 추정을 사용하지 않는다. 일반적인 접근은 각 생성 단계의 상태 가치나 어드밴티지를 추정합니다. BPO는 완성된 생성 궤적을 직접 활용해 이 과정을 생략합니다.
- 이론적 최적해를 보존한다. 논문은 궤적 수준으로 재구성된 목표가 원래 PMD 목표와 동일한 유일 최적해를 갖는다고 증명합니다. 따라서 임의의 손실 변경이 아니라, 기존 최적화 문제에 대한 이론적 재표현으로 볼 수 있습니다.
- 정책 불일치를 보정한다. 샘플을 만든 정책과 현재 업데이트되는 정책은 서로 다를 수 있습니다. BPO는 궤적 목표를 근사하고, 보완 토큰 확률의 평활화 비율을 사용해 이 차이를 조정합니다.
- 수학 추론에 적용된다. 수학 추론 벤치마크에서 유효성을 확인하는 실험이 보고되었습니다. 다만 제공된 자료에는 구체적인 벤치마크명, 모델 규모, 성능 향상 수치가 포함되어 있지 않습니다.
의미와 영향
종료 보상만 주어지는 언어 모델 강화학습에서는 비평자가 각 부분 시퀀스의 가치를 학습해야 합니다. 그러나 직접적인 감독 신호는 생성이 끝난 뒤에 도착하므로, 중간 상태의 가치 추정은 추가적인 모델링 복잡성과 오차를 초래할 수 있습니다. BPO는 벨만 방정식을 통해 PMD 목표를 완전한 궤적 위에 표현함으로써, 종료 보상과 토큰 단위 정책 업데이트 사이의 연결을 단순화하려 합니다.
실용 손실에서 사용하는 확률 비율도 BPO의 특징입니다. BPO는 Group-Relative Policy Optimization(GRPO)의 중요도 샘플링 비율을 그대로 사용하지 않고, 보완 토큰 확률을 이용한 평활화 비율로 대체합니다. 이는 자기회귀 생성에서 서로 다른 정책 사이의 불일치를 보정하면서 극단적인 비율의 영향을 완화하려는 설계입니다. 다만 제공된 자료만으로 모든 학습 조건에서의 안정성이나 우월성을 단정할 수는 없습니다.
논문에 첨부된 논의는 BPO가 다른 오프폴리시 강화학습 방법과 동일한 핵심 그래디언트를 공유할 수 있다는 점도 언급합니다. 두 방법은 서로 다른 방식으로 핵심 그래디언트에 도달하며, KL 항의 근사도 다릅니다. BPO는 이 항에 이진 근사와 가산 평활화를 적용합니다. 이는 서로 다른 이론적 출발점이 유사한 최적화 신호로 이어질 수 있음을 보여주는 관찰입니다.
BPO는 RLVR에서 비평자 없는 정책 최적화를 구현하는 이론적 대안을 제시합니다. 수학 추론을 넘어선 작업, 다양한 모델 규모와 샘플링 조건에서도 일관된 효과를 보이는지는 후속 연구와 더 폭넓은 실험이 필요합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…