아티클 목록으로
강화학습

QwenGyre, 장기 에이전트 강화학습의 GPU 유휴와 궤적 중복을 줄인다

약 3분 소요

배경

에이전트가 짧은 답변을 넘어 코드 저장소 수정이나 여러 단계의 복합 작업을 수행하면서 온라인 강화학습의 병목도 달라지고 있다. 한 번의 롤아웃이 수시간 이어지고, 모델과 환경 사이의 상호작용이 수백 회에 달하며, 거의 100만 토큰을 생성할 수 있기 때문이다. 실행마다 소요 시간이 크게 다르면 일부 작업이 끝나기를 기다리는 동안 GPU가 놀게 된다. 여기에 작업 중간의 비선형적인 분기까지 더해지면 사실상 비슷한 경로가 반복 생성되어 학습 데이터와 처리 비용이 커진다.

Qwen의 논문은 이러한 extreme-long, 즉 xlong 작업을 대상으로 하는 엔드투엔드 온라인 강화학습 프레임워크 QwenGyre를 제안한다. 핵심은 개별 추론을 조금 빠르게 만드는 데 그치지 않고, 롤아웃 생성부터 학습 데이터 처리까지 전체 파이프라인을 함께 최적화하는 것이다.

핵심 구성

  • 탄력적인 GPU 재배치. QwenGyre는 롤아웃과 학습 사이에서 GPU를 동적으로 재분배한다. 진행 중인 실행을 중단하지 않는 방식으로 설계되어, 롤아웃 시간 편차로 발생하는 대기와 유휴를 줄이는 것을 목표로 한다.
  • 분기 이력 재구성. 궤적 처리기는 서로 다른 분기 경로를 각각 완전히 독립된 샘플로 취급하지 않고, 실행 이력을 재구성한다. 이를 통해 경로가 언제 어떻게 갈라졌는지를 학습 처리에 반영할 수 있다.
  • 부분 진행도 평가. 긴 작업이 최종 상태에 도달하기 전에도 진행 상황을 점수화한다. 최종 성공 여부에만 의존하지 않고, 미완료 실행에서도 학습 신호를 확보하려는 접근이다.
  • 중복 궤적 제거. 유사하거나 반복되는 경로를 걸러내 학습 데이터 규모를 통제한다. 복잡한 상호작용에서 분기가 폭발하는 문제를 완화하는 역할을 한다.

실험 결과와 의미

논문에 따르면 Qwen 3.8 2.4T 모델과 롤아웃당 약 700K 토큰의 설정에서, 48단계 이후 NL2RepoBench 결과가 52.5%에서 58.5%로 높아졌다. 이는 절대 기준 6%포인트의 향상이다. 여러 학습 데이터 영역을 대상으로 한 평가에서는 Colocate 대비 최대 1.85배, Async 대비 최대 1.78배의 속도 향상이 보고됐다.

이 결과가 보여주는 중요한 점은 장기 에이전트 학습이 모델만의 문제가 아니라 시스템 문제이기도 하다는 것이다. 실행 시간의 편차, GPU 유휴, 유사한 분기 경로가 동시에 존재하면 더 많은 연산 자원을 투입해도 효율이 제한될 수 있다. QwenGyre는 스케줄링, 분기 이력 재구성, 진행도 평가, 중복 제거를 하나의 학습 흐름으로 묶어 코드 에이전트처럼 지속적인 상호작용이 필요한 분야에 적용할 수 있는 시스템적 방향을 제시한다.

다만 제공된 소재만으로는 각 구성요소의 기여도, 추가적인 스케줄링 오버헤드, 다양한 모델과 작업에서의 재현성까지 판단하기 어렵다. 따라서 제시된 속도와 성능 수치는 논문이 보고한 조건에서의 결과로 이해해야 하며, 모든 xlong 작업에 일반적으로 적용된다고 보기는 어렵다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
VLA-Precision: VLA 로봇의 실세계 온라인 강화학습을 안정화하다
강화학습
cctest.ai
강화학습

VLA-Precision: VLA 로봇의 실세계 온라인 강화학습을 안정화하다

VLA-Precision은 시각-언어-행동 모델을 실세계에서 온라인 강화학습할 때 발생하는 정책 드리프트와 대규모 모델의 처리 부담을 다룬다. ACoB 알고리즘과 ACoB-Stream 아키텍처를 결합해 정밀 조작을 위한 학습 안정성과 처리 효율을 높이는 접근이다.

더 보기