아티클 목록으로
강화학습

SLCA-GRPO, 도구 호출 강화학습의 신용 할당 오류를 줄이다

약 3분 소요

들어가며

도구 호출 에이전트의 출력은 한 가지 형식으로만 구성되지 않습니다. 모델은 구조화된 함수 호출을 생성한 뒤 사용자에게 결과를 설명하거나 요약하는 자연어를 이어서 출력합니다. 이처럼 역할이 다른 세그먼트가 하나의 궤적에 섞이면, GRPO와 같은 온폴리시 강화학습 알고리즘에서 신용 할당 문제가 발생할 수 있습니다.

일반적인 설정에서는 여러 rollout으로부터 궤적 전체를 대표하는 하나의 스칼라 어드밴티지를 계산하고, 이를 모든 토큰에 적용합니다. 그러면 요약의 품질과 관련된 보상이 도구 선택 토큰으로 흘러갈 수 있습니다. 반대로 도구 실행 결과의 변동이 자연어 요약 학습을 방해할 수도 있습니다.

논문은 이 문제를 해결하기 위해 Segment-Locked Credit Assignment, 즉 SLCA를 포함한 SLCA-GRPO를 제안합니다. 동시에 고비용의 실제 API를 반복 호출하지 않고 탐색과 학습을 수행할 수 있도록 Schema-Guided LLM Simulator, SGLS도 구축했습니다.

핵심 아이디어

  • 세그먼트별 어드밴티지 계산: 같은 rollout 그룹 안에서 도구 호출과 요약 세그먼트를 구분해 각각의 학습 신호를 계산합니다.
  • 보상 신호 분리: Hierarchical Rewards와 결합해 실행 관련 어드밴티지는 도구 토큰으로, 선호 관련 어드밴티지는 요약 토큰으로 보냅니다.
  • 추가 중간 상태 rollout 불필요: 중간 상태에서 별도의 rollout을 다시 수집하지 않고 기존 그룹 기반 샘플링 방식을 사용할 수 있습니다.
  • 스키마 기반 시뮬레이션: SGLS는 구조화된 도구 환경을 제공해 실제 서비스 호출 비용을 낮추고 탐색을 확장할 수 있게 합니다.

보고된 결과

7B 백본 실험에서 SLCA-GRPO는 표준 GRPO, ToolPO, RLTR보다 빠르게 수렴했고, 동일한 학습 예산에서도 더 높은 성능을 보였다고 보고됐습니다. 도메인 내 평가에서는 2.53%포인트, Berkeley Function-Calling Leaderboard에서는 1.36%포인트, τ²-Bench에서는 9.15%포인트 향상됐습니다. 세 개의 Qwen 백본과 분포 내·외 도구 호출 벤치마크에서도 작업 성공률이 높아졌고 도구 호출 턴은 감소했습니다.

의미와 남은 과제

이 연구의 핵심 시사점은 혼합 형식의 출력 전체를 동일한 학습 대상으로 취급해서는 안 된다는 것입니다. 도구를 선택하는 결정과 결과를 설명하는 언어 생성은 한 궤적에 함께 나타나지만, 평가 기준과 보상 출처가 다릅니다. 각 신호를 해당 세그먼트에만 고정하면 정책 업데이트의 방향을 더 선명하게 만들 수 있습니다.

다만 성능은 보상 계층의 설계와 시뮬레이터의 품질에 영향을 받습니다. SGLS가 실제 API의 예외 상황을 얼마나 잘 재현하는지, 세그먼트별 보상이 길고 복잡한 다중 턴 작업에서도 안정적인지는 추가 검증이 필요합니다. 그럼에도 SLCA-GRPO는 도구 중복 사용을 줄이고 에이전트 학습을 효율화하는 구체적인 접근을 제시합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
BPO, 비평자 없이 검증 가능한 보상으로 LLM을 학습하다
강화학습
cctest.ai
강화학습

BPO, 비평자 없이 검증 가능한 보상으로 LLM을 학습하다

Bellman Policy Optimization(BPO)은 종료 보상을 사용하는 자기회귀 생성 모델을 위한 비평자 없는 정책 최적화 방법입니다. 정책 미러 하강을 궤적 수준의 목적함수로 재구성하고, 보완 토큰 확률의 평활화 비율로 정책 불일치를 보정합니다.

더 보기