아티클 목록으로
AI 에이전트

OpenForgeRL: 실제 Harness 환경에서 AI Agent를 끝까지 훈련하다

약 3분 소요

들어가며

현대 AI Agent는 단순한 모델 호출보다 복잡한 추론 harness에 더 많이 의존합니다. Claude Code, Codex, OpenClaw 같은 harness는 다중 턴 추론, 도구 호출, 상태 관리, 외부 시스템 접근을 담당합니다. 실사용에서는 강력하지만, 훈련 관점에서는 문제가 됩니다. 기존 오픈 SFT/RL 스택은 상태가 있고 여러 프로세스가 얽힌 harness 추론을 그대로 표현하기 어렵기 때문입니다.

OpenForgeRL은 이 간극을 줄이기 위한 오픈소스 프레임워크입니다. 복잡한 harness를 훈련용으로 다시 단순화하는 대신, 실제 배포에 쓰이는 harness와 환경 안에서 Agent를 직접 훈련하는 방식을 제안합니다.

핵심 내용

  • 추론과 훈련의 분리: OpenForgeRL은 경량 프록시를 두어 harness가 보내는 모델 호출을 처리하고, 그 호출을 표준 RL 코드베이스에서 사용할 수 있는 훈련 데이터로 기록합니다. 논문에서는 veRL 같은 스택과의 연결을 예로 듭니다.
  • 격리된 rollout 실행: Kubernetes 오케스트레이터가 각 rollout을 별도의 원격 컨테이너에서 실행합니다. 도구, 브라우저, GUI, 컴퓨터 사용 환경을 다루는 Agent에서는 이런 격리가 확장성과 재현성에 중요합니다.
  • harness-native 훈련: 프레임워크는 실제 harness의 상태 관리와 다중 프로세스 흐름을 전제로 합니다. 즉, 연구자가 Codex나 OpenClaw류의 동작을 단순 시뮬레이터로 재작성하지 않아도 됩니다.
  • 다양한 Agent 유형 검증: 평가 범위는 도구/Claw 기반 Agent와 멀티모달 GUI, 브라우저, 컴퓨터 사용 Agent를 포함합니다. OpenForgeClaw는 ClawEval에서 31.7 pass^3 및 55.9 pass@3, QwenClawBench에서 33.7을 기록했습니다. OpenForgeGUI는 OSWorld-Verified 37.7, Online-Mind2Web 63.0, WebVoyager 72.3을 보고했습니다.

의미와 영향

OpenForgeRL의 의미는 단순히 점수 향상에 그치지 않습니다. Agent의 품질은 기반 모델만으로 결정되지 않습니다. 어떤 harness를 쓰는지, 도구를 어떻게 선택하는지, 스스로 검증하는지, 환경 피드백을 어떻게 반영하는지가 모두 결과를 바꿉니다. OpenForgeRL은 이 전체 루프를 훈련 과정에 더 직접적으로 포함할 수 있게 합니다.

논문은 harness 선택에 따라 학습 난도가 크게 달라지며, RL이 자기 검증, 도구 커버리지, 다단계 계획 완료 같은 신뢰성 관련 행동을 개선한다고 분석합니다. 다만 오류 복구 같은 핵심 능력은 여전히 약하다고 지적합니다.

오픈소스 Agent 생태계에서 이 프레임워크는 “프롬프트로 작동하는 Agent”를 “실제 harness 안에서 훈련되는 Agent”로 발전시키는 실용적 기반이 될 수 있습니다. 앞으로 코드와 실험이 충분히 공개·재현된다면, Agent harness 설계와 RL 알고리즘을 비교하는 공통 인프라 역할도 기대할 수 있습니다.

Source: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물