아티클 목록으로
코딩 AI

LEGO-RL, 네이티브 코딩 Harness를 강화학습에 연결하다

약 3분 소요

들어가며

코딩 에이전트를 학습시키는 일은 그럴듯한 코드 한 조각을 생성하게 만드는 것보다 어렵습니다. 실제 에이전트는 저장소를 읽고, 터미널과 각종 도구를 호출하고, 테스트를 실행한 뒤 실패 결과를 반영해 다음 행동을 선택합니다. 긴 작업에서는 컨텍스트를 압축하거나 메시지를 다시 직렬화하기도 합니다. 이런 과정을 관리하는 Harness는 실사용 환경에 가깝지만 정책 경사 기반 강화학습과는 자연스럽게 맞지 않습니다. 환경이 중단되면 결과 신호가 오염되고, 에이전트가 보상 구조의 허점을 이용할 수 있으며, 롤아웃에서 기록된 행동 확률과 학습기가 다시 계산하는 확률이 달라질 수 있기 때문입니다.

LEGO-RL은 Harness 내부의 제어 흐름을 수정하지 않은 채 이 실행 환경을 확장 가능한 강화학습 파이프라인에 연결하려고 합니다. 연구팀은 GSPO를 사용해 희소 혼합 전문가 모델 Qwen3.5-35B-A3B를 학습하고 세 종류의 네이티브 코딩 Harness에서 평가했습니다.

핵심 구성

  • 프로세스 내부 LLM 프록시. LEGO-RL은 Harness 프로세스 안에서 LLM 호출을 중계하고 원시 생성 스트림을 수집합니다. 이를 통해 토큰 수준 정렬과 트레이너 측 로그 확률 재계산을 지원합니다. Harness가 컨텍스트를 압축하거나 메시지를 다시 직렬화하더라도 실제 생성 과정에 가까운 정보를 활용하려는 설계입니다.
  • 신뢰할 수 있는 실행 환경. 확장 가능한 샌드박스 오케스트레이션, 이미지 캐시, 단계별 방어를 사용해 실행 장애가 결과에 미치는 영향을 줄이고 보상 해킹 가능성을 완화합니다.
  • 학습 과정의 관측성. 통합 플러그인은 검증과 모니터링을 자동화하며, Live UI는 세부 궤적 진단을 제공합니다. 연구자는 도구 호출, 실행 결과, 보상 사이의 관계를 추적할 수 있습니다.
  • 여러 Harness에서 성능 개선. SWE-bench Verified에서 OpenHands SDK는 64.0%에서 70.4%로, Claude Code는 62.4%에서 68.2%로, OpenCode는 57.2%에서 66.6%로 향상됐습니다.

의미와 한계

LEGO-RL의 핵심 메시지는 코딩 에이전트 강화학습에서 모델 정책과 실행 런타임을 분리해서 보기 어렵다는 것입니다. 장기 소프트웨어 작업에서 모델의 출력은 전체 과정 중 한 단계에 불과합니다. 도구 프로토콜, 컨텍스트 관리, 예외 처리, 테스트 피드백을 학습 환경이 제대로 반영하지 않으면 단순화된 실험에서는 잘 작동한 정책이 실제 Harness에서는 다르게 행동할 수 있습니다.

이 프레임워크는 기존 Harness를 유지하면서 최적화, 안정적인 실행, 진단에 필요한 연결 지점을 추가합니다. 따라서 연구 모델을 서로 다른 코딩 에이전트 기반에 적용하고 비교하는 비용을 낮출 가능성이 있습니다. 다만 현재 제공된 자료만으로는 각 구성요소의 독립적인 기여도, 학습 비용, 다른 모델과 작업으로의 일반화 여부를 판단하기 어렵습니다. 전체 효과를 확인하려면 더 자세한 제거 실험과 독립적인 재현이 필요합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물