아티클 목록으로
강화학습

Agent Lightning v1.0, 에이전트 하니스를 강화학습에 연결하다

약 3분 소요

들어가며

검색이나 코드 실행, 외부 도구 사용이 가능한 에이전트는 LLM 하나만으로 구성되지 않는다. 어떤 도구를 언제 호출할지, 이전 결과를 어떻게 컨텍스트에 넣을지, 다음 단계를 어떻게 결정할지는 에이전트 하니스가 관리한다. Agent Lightning v1.0은 실제 배포에 사용되는 이 하니스를 강화학습에 어떻게 연결할지 탐구한다.

핵심 내용

  • 하니스를 후학습의 일부로 본다. 논문은 이 방식을 “harnessed agentic RL”이라고 부른다. 전통적인 에이전트 강화학습에서는 학습 엔진이 환경 상호작용 루프를 통제하지만, 이 구조에서는 하니스가 상호작용을 진행하고 트레이너는 LLM 요청-응답 시퀀스만 관찰한다.
  • LLM 엔드포인트 프록시로 연결한다. Agent Lightning은 LLM 호출을 중계하는 프록시를 통해 임의의 에이전트 하니스와 RL 학습 시스템을 연결한다. 배포용 에이전트의 제어 로직을 학습 전용 구조에 맞게 크게 다시 작성하지 않아도 된다는 점이 장점이다.
  • 데이터 구성과 실행 방식이 중요하다. 여러 번의 LLM 호출을 어떻게 재토큰화하고 하나의 학습 샘플로 합칠지 결정해야 한다. 또한 어드밴티지를 각 호출에 어떻게 계산할지, 손실을 어떻게 정규화할지, 학습 백엔드를 어떻게 스케줄링할지도 정해야 한다. 이런 선택이 부적절하면 학습이 불안정하거나 효과가 낮아질 수 있다.
  • 작고 재현 가능한 프레임워크를 지향한다. 약 3,500줄의 코드로 구성되며, 지시 수행·검색·코딩 에이전트를 지원한다. 코딩 에이전트 실험을 위해 데이터 정제 파이프라인과 전체 학습 스크립트도 제공한다.

의미와 영향

코딩 에이전트 실험에서 연구진은 6,000개의 학습 예제와 비교적 적은 컴퓨팅 자원을 사용했다. 그 결과 Qwen3.5-9B의 SWE-bench Verified 점수는 41.8%에서 56.4%로 상승했으며, 절대 기준 14.6%포인트 개선됐다. 이는 코드 에이전트 강화학습이 반드시 대규모 전용 인프라에만 의존해야 하는 것은 아닐 수 있음을 보여준다.

더 큰 의미는 에이전트 하니스를 단순한 실행 보조 소프트웨어가 아니라 학습 시스템의 핵심 요소로 다룬 데 있다. 다단계 도구 사용과 동적으로 변하는 컨텍스트에서는 단순한 입출력 로그만으로 각 호출의 기여도를 판단하기 어렵다. Agent Lightning은 이런 문제를 실험할 수 있는 간결한 테스트베드를 제시한다.

다만 제공된 자료만으로 모든 모델과 작업, 하니스에서 동일한 성능이 재현된다고 결론 내릴 수는 없다. 다양한 하니스와 보상 설계, 학습 백엔드에서의 추가 비교가 실제 범용성을 확인하는 다음 단계가 될 것이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Co-RL, 다양한 AI 집단의 협력으로 비지도 추론을 학습하다
강화학습
cctest.ai
강화학습

Co-RL, 다양한 AI 집단의 협력으로 비지도 추론을 학습하다

Co-RL은 파라미터를 공유하지 않는 여러 모델이 서로의 피드백에서 보상을 얻도록 하는 다중 에이전트 강화학습 프레임워크입니다. 정답 라벨 없이도 텍스트와 멀티모달 추론 성능을 높이고 자기 보상 학습의 붕괴 위험을 완화합니다.

더 보기
CCTest · Blog
DAPD: 정책 증류에서 ‘특권 정보 착각’을 줄이는 방법
강화학습
cctest.ai
강화학습

DAPD: 정책 증류에서 ‘특권 정보 착각’을 줄이는 방법

DAPD 논문은 온폴리시 자기 증류에서 발생하는 성능 저하를 교사와 학생이 접근할 수 있는 정보의 비대칭 문제로 설명합니다. 두 단계의 앵커링을 통해 추론 시 재현할 수 없는 특권 의존 행동이 학생에게 전달되는 것을 줄이려 합니다.

더 보기
CCTest · Blog
SAF-OPD: 강화학습과 온폴리시 증류를 안정적으로 결합하는 방법
강화학습
cctest.ai
강화학습

SAF-OPD: 강화학습과 온폴리시 증류를 안정적으로 결합하는 방법

SAF-OPD는 검증 가능한 보상 기반 강화학습과 온폴리시 증류를 단순히 고정 비율로 섞을 때 발생하는 불안정성을 다룬다. 교사 신호의 크기와 적용 시점을 조절해 탐색 능력을 보존하는 것이 핵심이다.

더 보기