아티클 목록으로
코딩 AI

하나에서 여러 전문가로, 다시 하나로: 범주 인식형 SWE 에이전트 훈련

약 3분 소요

문제의식

리포지토리 수준의 소프트웨어 엔지니어링은 하나의 균질한 능력이 아닙니다. 버그 수정, 기능 추가, 테스트 변경, 여러 파일에 걸친 수정은 서로 다른 추론과 도구 사용 방식을 요구할 수 있습니다. 이 작업들을 하나의 강화학습 풀에 섞어 훈련하면 평균 성공률은 높아져도 특정 범주의 성능이 정체되거나 하락할 수 있습니다. 논문 One to More, More to One은 이 현상을 범주 간 ‘시소’로 보고, 먼저 전문가를 분화해 훈련한 뒤 다시 하나의 모델로 통합하는 방식을 제안합니다.

핵심 구성

  • 실행 가능한 작업과 라벨을 사용한다. 연구진은 실행 가능한 작업 구축 과정과 증거 기반 다축 라벨링 시스템인 SWE Labeler를 활용해 훈련 풀을 범주별로 정리합니다. 이를 통해 전체 점수뿐 아니라 각 범주의 변화도 살펴볼 수 있습니다.
  • 범주별 전문가를 만든다. 각 범주에 특화된 강화학습을 수행합니다. 초기 단계에서 평균 훈련 성공률은 개선되지만, 모든 인스턴스가 균일하게 좋아지는 것은 아니므로 성공 행동의 명시적 통합과 정책 적응형 작업 선택이 필요하다는 것이 연구의 관찰입니다.
  • RRE를 반복한다. Refresh–Repair–Expand는 장기 Agentic-miniRL을 세 가지 작업과 결합합니다. 업데이트된 정책으로 기존 인스턴스의 숙련도를 다시 확인하고, 정책 자체가 검증한 성공 궤적을 Repair SFT에 재사용한 뒤, 추가 강화학습을 위해 작업을 다시 선택합니다. 성공 결과를 수정용 학습 신호로 활용하면서 아직 충분히 학습되지 않은 작업도 계속 탐색하는 구조입니다.
  • 전문가를 하나의 학생 모델로 합친다. 라벨 라우팅 방식의 다중 교사 온폴리시 증류(MOPD)는 작업 범주에 맞는 교사의 신호를 선택해 단일 배포 모델에 통합합니다. 또한 ReLU 게이트 보상 외삽을 사용해 기준 정책보다 개선되는 방향만 남김으로써, 서로 다른 전문가의 신호가 무분별하게 충돌하는 것을 줄입니다.

결과와 의미

평가는 혼합 RL, 균형 RL, 전문가 개발, 단일 모델 통합을 비교하고 전체 및 범주별 성능을 함께 분석합니다. 연구는 최종 모델이 Pro-618에서 58.04%, SWE-bench Multilingual에서 59.00%를 달성했다고 보고합니다. 이 접근의 의미는 특정 벤치마크 점수에만 있지 않습니다. 평균 점수 상승 뒤에 가려질 수 있는 범주별 퇴보를 함께 점검하도록 훈련과 평가의 관점을 바꾼다는 데 있습니다.

전문가 훈련과 정책 통합에는 외부 모델이 만든 해답 궤적이나 행동 라벨이 필요하지 않습니다. 실행 환경의 결과와 정책 자신이 검증한 성공 궤적을 사용하기 때문입니다. 다만 범주 라벨의 신뢰성, 작업 라우팅의 안정성, 다른 리포지토리와 벤치마크로의 전이 가능성은 추가로 확인해야 합니다. 모델, 데이터셋, SWE Labeler 코드, 관련 실행 환경 이미지가 공개되어 있어 이러한 검증을 재현하기에 유리합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
CodeMidas, 소스 코드 자체로 코딩 에이전트 강화학습 환경 구축
코딩 AI
cctest.ai
코딩 AI

CodeMidas, 소스 코드 자체로 코딩 에이전트 강화학습 환경 구축

샤오미 MiMo 팀의 CodeMidas는 기존 소스 코드만을 바탕으로 기능을 탐색하고 실행 가능한 테스트를 생성한 뒤, 강화학습에 적합한 코딩 과제를 선별한다. 실험에서는 이 방식으로 학습한 에이전트가 코드 수정, 프로그램 구축, 터미널 작업 등 여러 벤치마크에서 성능을 높였다.

더 보기