아티클 목록으로
강화학습

Rufus-Air, 재현 가능한 8단계 LLM 후훈련 레시피 공개

약 3분 소요

들어가며

대규모 언어 모델의 경쟁은 사전학습 규모만이 아니라, 기반 모델을 실제로 사용할 수 있는 시스템으로 바꾸는 후훈련으로 이동하고 있다. Rufus-Air의 의미는 후훈련을 개별적인 기법 모음이 아니라 공개되고 재현 가능한 연속 공정으로 정리했다는 데 있다. GLM-4.5-Air-Base(106B-A12B)를 기반으로 추론, 코딩, 지시 따르기, 에이전트 능력을 어떤 순서로 확장하는지 설명한다.

점진적으로 구성된 8개 단계

Rufus-Air는 다음의 직렬 파이프라인을 사용한다.

  • SFT: 다양하고 품질 높은 데이터로 기본 능력의 하한선을 구축한다.
  • Reasoning RL: 추론 능력을 강화한다.
  • Coding RL: 코드 과제를 대상으로 강화학습을 수행한다.
  • Instruction-Following RL: 사용자 지시에 대한 준수 능력을 높인다.
  • General Agent: 일반 에이전트 과제로 범위를 넓힌다.
  • Coding Agent: 코딩 에이전트 시나리오에 집중한다.
  • Search Agent: 검색을 활용하는 에이전트 행동을 학습한다.
  • RLHF: 마지막에 선호도 중심의 강화학습을 적용한다.

이 구성에서 중요한 것은 단계의 개수보다 배치 순서다. 결과가 분명하고 검증하기 쉬운 과제를 먼저 다루고, 종합적인 판단이 필요한 복잡한 과제를 뒤로 보낸다. 보상 신호 역시 비교적 확실한 하드 보상에서 심판 모델에 의존하는 소프트 신호로 점진적으로 이동한다. 학습 초기에 모호한 최적화 목표가 불안정성을 키우는 문제를 줄이려는 접근이다.

네 가지 핵심 교훈

첫째, SFT는 단순한 준비 단계가 아니다. 다양하고 품질 높은 지도 데이터가 이후 강화학습이 확장할 수 있는 능력의 기반을 결정한다.

둘째, RL 프롬프트의 난이도를 조절해야 한다. 너무 쉬운 문제는 유용한 학습 신호가 부족하고, 지나치게 어려운 문제는 효율적인 최적화를 방해할 수 있다. 도전적이면서도 학습 가능한 범위로 데이터를 걸러내는 것이 실용적인 방법이다.

셋째, 보상의 신뢰성은 단계 순서를 정하는 기준이 될 수 있다. 실행 가능한 테스트나 명확한 정답은 초기 단계에 적합하고, 심판 모델 기반 보상은 기본 능력이 형성된 뒤 도입하는 편이 더 적절하다.

넷째, 인프라는 구현 세부사항이 아니라 레시피의 일부다. 데이터 파이프라인, 학습 시스템, 평가 절차, 단계 간 연결이 모두 결과에 영향을 주므로 알고리즘 이름만으로는 재현성을 보장할 수 없다.

의미와 영향

Rufus-Air는 오픈 모델 후훈련에 강력한 기반 모델만 필요한 것이 아니라, 데이터 관리와 보상 설계, 엔지니어링 실행을 안정적인 절차로 조직해야 한다는 점을 보여준다. 저자들은 공식 GLM-4.5-Air 후훈련 릴리스보다 개선되었고, 비슷한 규모의 오픈 모델과 경쟁력 있는 결과를 보였다고 설명한다. 또한 오픈소스 구성요소와 공개 데이터를 중심으로 사용했으며, 새로운 인간 주석이나 사내 증류 교사에 의존하지 않았다고 밝힌다.

연구자에게는 각 단계가 능력에 미치는 영향을 따로 분석할 수 있는 실험 틀이 된다. 모델 개발자에게 주는 메시지는 분명하다. 후훈련은 RL을 한 번 추가하는 작업이 아니라, 능력의 기반과 보상의 신뢰성, 과제 복잡도를 함께 관리하는 시스템工程이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
BPO, 비평자 없이 검증 가능한 보상으로 LLM을 학습하다
강화학습
cctest.ai
강화학습

BPO, 비평자 없이 검증 가능한 보상으로 LLM을 학습하다

Bellman Policy Optimization(BPO)은 종료 보상을 사용하는 자기회귀 생성 모델을 위한 비평자 없는 정책 최적화 방법입니다. 정책 미러 하강을 궤적 수준의 목적함수로 재구성하고, 보완 토큰 확률의 평활화 비율로 정책 불일치를 보정합니다.

더 보기