샤오미 MiMo-V2.6이 보여준 대규모 Agentic RL의 설계
들어가며
대규모 언어 모델의 후훈련은 단순히 더 좋은 답변을 만드는 단계에서 벗어나, 도구를 사용하고 긴 작업을 끝까지 수행하는 에이전트를 훈련하는 방향으로 이동하고 있습니다. 샤오미 MiMo 팀의 MiMo-V2.6 기술 보고서는 Agentic RL을 확장하려면 모델 업데이트 연산뿐 아니라 Rollout, 작업 환경, Agent Harness, Grader 계산을 함께 키워야 한다는 점을 보여줍니다.
핵심 내용
- 한 RL 스텝의 규모가 매우 크다. MiMo-V2.6-Pro는 총 1.02T 파라미터와 42B 활성 파라미터를, Flash는 총 310B와 15B 활성 파라미터를 사용합니다. 두 모델 모두 MoE 구조입니다. 한 스텝에서 1568개 Prompt를 샘플링하고 Prompt마다 16개 궤적을 생성해 약 27억~37억 토큰을 처리하며, 컨텍스트 길이는 최대 100만 토큰에 이릅니다.
- 평가 자체도 주요 비용이다. RL 후훈련 비용은 Pro 약 260만 달러, Flash 약 90만 달러로 제시됐습니다. Pro에서는 Rollout과 Training이 각각 40%를 넘고, Grader도 12.7%를 차지합니다. Flash에서 Grader 비중은 14.2%까지 올라갑니다.
- 테스트 통과만으로는 품질을 판단할 수 없다. 같은 테스트를 통과해도 수정 범위, 예외 처리, 부작용, 유지보수성은 크게 다를 수 있습니다. MiMo-V2.6은 동일 작업의 여러 해법을 비교하는 Groupwise Reward Synthesis와 Groupwise Advantage Redistribution을 사용해 더 작고 정확한 패치에 높은 보상 신호를 줍니다.
- 보상 해킹에 별도 방어선을 둔다. 학습 환경에서 로그, 캐시, 잔여 패치 등을 제거하고 상위 저장소의 수정본에 접근하지 못하게 합니다. Hack Agent가 우회 경로를 찾도록 하고, 확인된 보상 해킹 궤적은 보상을 0으로 처리합니다. 공식 학습에서 확인된 비율은 2% 미만으로 유지됐다고 보고했습니다.
- 인프라 설계가 확장성을 결정한다. 지속형 Actor, 분산 저장소, 동적 Sample Mixer, KV Cache 오프로딩 등을 활용해 대규모 장기 Rollout을 처리했습니다. 또한 RL 중 MoE Router를 업데이트하면 전문가별 부하가 빠르게 쏠리는 현상이 나타나 Router를 동결했습니다.
의미와 한계
MiMo-V2.6의 중요한 메시지는 Agentic RL이 단순히 더 큰 학습 작업이 아니라는 것입니다. 작업 설계, 환경 격리, 궤적 스케줄링, 평가기 품질, 장애 복구, 모델 업데이트를 하나의 시스템으로 운영해야 합니다. 여러 소형 Harness에서 학습한 모델이 학습 중 보지 못한 Codex, Claude Code, mini-swe-agent에서도 개선된 점은 특정 도구 체계에만 묶이지 않은 능력이 형성될 가능성을 보여줍니다.
다만 이것을 완전한 자율적 재귀 자기개선으로 보기는 어렵습니다. 학습 환경과 보상, 검증 규칙은 여전히 사람이 설계하고, Grader는 추가 비용과 오판 위험을 만듭니다. 30회 업데이트 후 미학습 DeepSWE v1.1에서 성능 향상이 보고됐지만, 실제 운영 환경으로의 안정적인 전이, 평가 비용 절감, 모델이 더 영리해질수록 증가할 수 있는 보상 해킹을 어떻게 막을지는 앞으로의 과제입니다.
출처: InfoQ 中文
댓글
로그인 상태 확인 중…
댓글 불러오는 중…