SLCA-GRPO, 도구 호출 강화학습의 신용 할당 오류를 줄이다
들어가며
도구 호출 에이전트의 출력은 한 가지 형식으로만 구성되지 않습니다. 모델은 구조화된 함수 호출을 생성한 뒤 사용자에게 결과를 설명하거나 요약하는 자연어를 이어서 출력합니다. 이처럼 역할이 다른 세그먼트가 하나의 궤적에 섞이면, GRPO와 같은 온폴리시 강화학습 알고리즘에서 신용 할당 문제가 발생할 수 있습니다.
일반적인 설정에서는 여러 rollout으로부터 궤적 전체를 대표하는 하나의 스칼라 어드밴티지를 계산하고, 이를 모든 토큰에 적용합니다. 그러면 요약의 품질과 관련된 보상이 도구 선택 토큰으로 흘러갈 수 있습니다. 반대로 도구 실행 결과의 변동이 자연어 요약 학습을 방해할 수도 있습니다.
논문은 이 문제를 해결하기 위해 Segment-Locked Credit Assignment, 즉 SLCA를 포함한 SLCA-GRPO를 제안합니다. 동시에 고비용의 실제 API를 반복 호출하지 않고 탐색과 학습을 수행할 수 있도록 Schema-Guided LLM Simulator, SGLS도 구축했습니다.
핵심 아이디어
- 세그먼트별 어드밴티지 계산: 같은 rollout 그룹 안에서 도구 호출과 요약 세그먼트를 구분해 각각의 학습 신호를 계산합니다.
- 보상 신호 분리: Hierarchical Rewards와 결합해 실행 관련 어드밴티지는 도구 토큰으로, 선호 관련 어드밴티지는 요약 토큰으로 보냅니다.
- 추가 중간 상태 rollout 불필요: 중간 상태에서 별도의 rollout을 다시 수집하지 않고 기존 그룹 기반 샘플링 방식을 사용할 수 있습니다.
- 스키마 기반 시뮬레이션: SGLS는 구조화된 도구 환경을 제공해 실제 서비스 호출 비용을 낮추고 탐색을 확장할 수 있게 합니다.
보고된 결과
7B 백본 실험에서 SLCA-GRPO는 표준 GRPO, ToolPO, RLTR보다 빠르게 수렴했고, 동일한 학습 예산에서도 더 높은 성능을 보였다고 보고됐습니다. 도메인 내 평가에서는 2.53%포인트, Berkeley Function-Calling Leaderboard에서는 1.36%포인트, τ²-Bench에서는 9.15%포인트 향상됐습니다. 세 개의 Qwen 백본과 분포 내·외 도구 호출 벤치마크에서도 작업 성공률이 높아졌고 도구 호출 턴은 감소했습니다.
의미와 남은 과제
이 연구의 핵심 시사점은 혼합 형식의 출력 전체를 동일한 학습 대상으로 취급해서는 안 된다는 것입니다. 도구를 선택하는 결정과 결과를 설명하는 언어 생성은 한 궤적에 함께 나타나지만, 평가 기준과 보상 출처가 다릅니다. 각 신호를 해당 세그먼트에만 고정하면 정책 업데이트의 방향을 더 선명하게 만들 수 있습니다.
다만 성능은 보상 계층의 설계와 시뮬레이터의 품질에 영향을 받습니다. SGLS가 실제 API의 예외 상황을 얼마나 잘 재현하는지, 세그먼트별 보상이 길고 복잡한 다중 턴 작업에서도 안정적인지는 추가 검증이 필요합니다. 그럼에도 SLCA-GRPO는 도구 중복 사용을 줄이고 에이전트 학습을 효율화하는 구체적인 접근을 제시합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…