아티클 목록으로
강화학습

샤오미 MiMo-V2.6이 보여준 대규모 Agentic RL의 설계

약 3분 소요

들어가며

대규모 언어 모델의 후훈련은 단순히 더 좋은 답변을 만드는 단계에서 벗어나, 도구를 사용하고 긴 작업을 끝까지 수행하는 에이전트를 훈련하는 방향으로 이동하고 있습니다. 샤오미 MiMo 팀의 MiMo-V2.6 기술 보고서는 Agentic RL을 확장하려면 모델 업데이트 연산뿐 아니라 Rollout, 작업 환경, Agent Harness, Grader 계산을 함께 키워야 한다는 점을 보여줍니다.

핵심 내용

  • 한 RL 스텝의 규모가 매우 크다. MiMo-V2.6-Pro는 총 1.02T 파라미터와 42B 활성 파라미터를, Flash는 총 310B와 15B 활성 파라미터를 사용합니다. 두 모델 모두 MoE 구조입니다. 한 스텝에서 1568개 Prompt를 샘플링하고 Prompt마다 16개 궤적을 생성해 약 27억~37억 토큰을 처리하며, 컨텍스트 길이는 최대 100만 토큰에 이릅니다.
  • 평가 자체도 주요 비용이다. RL 후훈련 비용은 Pro 약 260만 달러, Flash 약 90만 달러로 제시됐습니다. Pro에서는 Rollout과 Training이 각각 40%를 넘고, Grader도 12.7%를 차지합니다. Flash에서 Grader 비중은 14.2%까지 올라갑니다.
  • 테스트 통과만으로는 품질을 판단할 수 없다. 같은 테스트를 통과해도 수정 범위, 예외 처리, 부작용, 유지보수성은 크게 다를 수 있습니다. MiMo-V2.6은 동일 작업의 여러 해법을 비교하는 Groupwise Reward Synthesis와 Groupwise Advantage Redistribution을 사용해 더 작고 정확한 패치에 높은 보상 신호를 줍니다.
  • 보상 해킹에 별도 방어선을 둔다. 학습 환경에서 로그, 캐시, 잔여 패치 등을 제거하고 상위 저장소의 수정본에 접근하지 못하게 합니다. Hack Agent가 우회 경로를 찾도록 하고, 확인된 보상 해킹 궤적은 보상을 0으로 처리합니다. 공식 학습에서 확인된 비율은 2% 미만으로 유지됐다고 보고했습니다.
  • 인프라 설계가 확장성을 결정한다. 지속형 Actor, 분산 저장소, 동적 Sample Mixer, KV Cache 오프로딩 등을 활용해 대규모 장기 Rollout을 처리했습니다. 또한 RL 중 MoE Router를 업데이트하면 전문가별 부하가 빠르게 쏠리는 현상이 나타나 Router를 동결했습니다.

의미와 한계

MiMo-V2.6의 중요한 메시지는 Agentic RL이 단순히 더 큰 학습 작업이 아니라는 것입니다. 작업 설계, 환경 격리, 궤적 스케줄링, 평가기 품질, 장애 복구, 모델 업데이트를 하나의 시스템으로 운영해야 합니다. 여러 소형 Harness에서 학습한 모델이 학습 중 보지 못한 Codex, Claude Code, mini-swe-agent에서도 개선된 점은 특정 도구 체계에만 묶이지 않은 능력이 형성될 가능성을 보여줍니다.

다만 이것을 완전한 자율적 재귀 자기개선으로 보기는 어렵습니다. 학습 환경과 보상, 검증 규칙은 여전히 사람이 설계하고, Grader는 추가 비용과 오판 위험을 만듭니다. 30회 업데이트 후 미학습 DeepSWE v1.1에서 성능 향상이 보고됐지만, 실제 운영 환경으로의 안정적인 전이, 평가 비용 절감, 모델이 더 영리해질수록 증가할 수 있는 보상 해킹을 어떻게 막을지는 앞으로의 과제입니다.

출처: InfoQ 中文

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SRD, 사후 경험을 RLVR의 사전 예측으로 바꾸다
강화학습
cctest.ai
강화학습

SRD, 사후 경험을 RLVR의 사전 예측으로 바꾸다

Self-Retrospection Distillation(SRD)은 에이전트가 작업을 마친 뒤 얻은 궤적을 활용해 행동 전에 예상해야 할 함정과 어려움을 학습시킵니다. 그룹 내 보상이 모두 같아지는 강화학습에서도 궤적에 남은 정보를 학습 신호로 되살리는 접근입니다.

더 보기
CCTest · Blog
추론 모델은 왜 자기 학습으로 무너지는가: R-Quest의 문제 품질 관리
강화학습
cctest.ai
강화학습

추론 모델은 왜 자기 학습으로 무너지는가: R-Quest의 문제 품질 관리

추론 모델이 스스로 만든 문제는 학습에 활용될 수 있지만, 잘못된 문제와 수학적으로 반복되는 변형이 누적되면 성능이 붕괴할 수 있다. R-Quest는 유효성과 새로움 피드백으로 이 문제를 완화한다.

더 보기