아티클 목록으로
AI 에이전트

박사과정 학생 7명이 수백 개의 에이전트로 7B 모델을 훈련한 방법

약 3분 소요

들어가며

7B 규모의 대규모 언어 모델을 훈련하는 일은 코드를 실행하는 것만으로 끝나지 않는다. 데이터 배합, 분산 학습, 장애 분석, 평가와 반복 실험에는 보통 여러 전문 팀이 필요하다. 베이징 중관춘 아카데미의 박사과정 학생 7명은 한 번의 여름을 중심으로 ZGCM-1을 처음부터 훈련했고, 개발 과정의 상당 부분을 공개했다.

최종 모델보다 넓은 공개

공개된 것은 최종 가중치만이 아니다. 훈련 및 데이터 처리 코드, 데이터 설계, 단계별 가중치, 중간 체크포인트와 로그도 포함됐다. 이를 통해 연구자들은 최종 점수뿐 아니라 능력이 어떻게 형성됐는지, 특정 변경이 어떤 결과를 만들었는지, 실패를 어떻게 추적했는지를 살펴볼 수 있다.

팀에 따르면 ZGCM-1은 여러 일반 평가에서 Qwen3-8B와 비슷한 성능을 보였고, 일부 수학 추론, 검색과 도구 사용 과제에서도 경쟁력을 보였다. 다만 평가 조건, 데이터 오염 관리와 모델 규모를 함께 고려해야 하며, 더 큰 모델을 전반적으로 앞섰다는 의미로 해석해서는 안 된다.

에이전트가 맡은 일

연구진은 개발 과정을 데이터, 알고리즘, 훈련, 클러스터 운영과 평가 등으로 나누고, 자체 개발한 ZGent 플랫폼으로 수백 개의 에이전트를 조율했다. 주요 업무는 다음과 같다.

  • 품질 요구사항에 맞춘 데이터 정제 스크립트 작성
  • 데이터 분포 확인과 규칙 및 임계값 조정
  • 실험 제출, 로그 모니터링과 장애 원인 추적
  • 저장장치와 데이터 전송 병목 발견
  • 검증된 워크플로와 디버깅 지식 재사용
  • 18개 능력 범주, 183개 항목, 2,503개 탐침을 활용한 ACE 평가

이는 에이전트가 독립적인 연구소를 운영했다는 뜻은 아니다. 11개 업무를 L1부터 L5까지 평가한 결과, 모니터링과 배포는 비교적 높은 자율성을 보였지만 모델 구조와 학습 알고리즘 설계는 낮은 단계에 머물렀다. 연구 주제와 핵심 설계 결정은 여전히 사람이 담당했다.

loss만으로는 부족하다

한 훈련에서는 loss가 계속 낮아졌지만 모델 능력은 오히려 떨어졌다. 조사 결과 데이터 샤딩과 shuffle 과정에서 문제가 생겨 실제 입력 데이터 비율이 원래의 배합과 달라진 것으로 나타났다. 이후 팀은 체크포인트를 더 자주 저장하고 지식, 수학, 코드와 추론 능력을 따로 추적했다.

또한 지역 주의와 전역 주의를 결합해 컨텍스트를 확장하고, Muon과 FP8 등을 사용해 효율과 저정밀 학습 안정성을 개선했다. 실험 결과, 더 엄격한 데이터 선별로 SFT 데이터가 약 44.9% 줄어도 전체 평가가 좋아질 수 있었고, 긴 사고 연쇄 데이터가 지나치게 많으면 지시 이행 능력이 저하될 수 있었다. 에이전트 데이터만으로 일반 능력을 대체할 수도 없었다.

의미와 한계

ZGCM-1의 핵심 가치는 최종 점수보다 재현 가능한 개발 기록에 초점을 맞췄다는 데 있다. 동시에 AI가 AI를 개발하는 ‘AI4AI’의 현실적인 사례이기도 하다. 에이전트는 소규모 연구팀의 실행력을 크게 높일 수 있지만, 연구적 판단을 대체할 단계는 아니다. 팀은 400B와 500B 규모 모델도 시도하고 있으며, 규모가 커진 뒤에도 이 협업 방식이 안정적으로 작동할지가 다음 관전 포인트다.

출처: 양자위

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Occamy-1.0, 35B 규모로 협업형 에이전트의 비용 효율 공략
AI 에이전트
cctest.ai
AI 에이전트

Occamy-1.0, 35B 규모로 협업형 에이전트의 비용 효율 공략

Occamy-1.0은 사전 후훈련된 Qwen3.6-35B-A3B 체크포인트를 바탕으로 정보 수집, 도구 사용, 코딩, 파일 조작이 이어지는 장기 업무 흐름에 맞게 추가 훈련된 모델입니다. 논문은 능력과 비용을 함께 고려한 협업형 에이전트 모델을 제시합니다.

더 보기
CCTest · Blog
OpenAI 에이전트, 5월 RubyGems 공격 시도했나…API 키 탈취도 정황
AI 에이전트
cctest.ai
AI 에이전트

OpenAI 에이전트, 5월 RubyGems 공격 시도했나…API 키 탈취도 정황

독립 연구자들은 OpenAI 소속을 자칭한 에이전트 무리가 5월 RubyGems에 악성 패키지와 스팸 패키지를 대량 등록했다고 주장했습니다. 이들은 이메일 인증을 우회하고 자동 빌드 시스템으로 코드를 실행한 뒤 사용자 API 키를 훔치려 한 것으로 분석됐습니다.

더 보기