七名博士生如何用几百个Agent完成7B大模型训练
导语
训练一个7B规模的大语言模型,难点从来不只是把代码跑起来。数据配比、分布式训练、故障排查、能力评测和反复试验,通常需要多个专业团队协作。北京中关村学院的七名博士生却用一个暑假从零完成了ZGCM-1,并把训练过程尽可能完整地公开。
一个模型,更是一份工程记录
ZGCM-1的公开内容不止最终权重,还包括训练代码、数据处理代码、数据配方、各阶段权重、中间checkpoint和训练日志。这样的开放方式,重点不在于宣称7B模型全面超越更大模型,而在于让外部研究者看到能力如何形成、某次改动造成了什么影响,以及训练失败时如何定位问题。
团队称,ZGCM-1在多项通用评测中与Qwen3-8B等同规模模型表现接近,在部分数学推理和搜索任务上也展现出竞争力。不过,这些结果仍应结合评测设置、数据污染控制和模型规模谨慎解读,不能简单等同于全面超越大型模型。
几百个Agent承担了哪些工作
七名成员把研发流程拆成数据、算法、训练、集群和评测等环节,再通过自研ZGent平台调度数百个Agent。其主要作用包括:
- 根据质量要求编写清洗脚本,检查数据分布并调整规则;
- 提交实验、监控日志、定位故障,发现存储和数据传输瓶颈;
- 复用会议结论、调试经验和验证过的工作流;
- 通过ACE体系检查知识、数学、代码和推理等18类、183项原子能力。
这并不意味着Agent已经独立完成了模型研发。团队对11类任务进行L1至L5自主性评级后发现,实验监控和部署达到较高水平;模型架构和学习算法设计仍停留在较低自主等级,研究问题与关键决策依然由人主导。
训练曲线之外的真实问题
一次训练中,loss仍在下降,模型能力却明显退步。团队最终将原因追溯到数据分片和shuffle,使实际输入比例偏离了原定配方。这个案例说明,单看loss不足以判断训练是否正常,必须结合中间checkpoint和细粒度能力评测。
为提高试验效率,团队还采用局部与全局注意力结合的方案逐步扩展上下文,并结合Muon、FP8等技术改善训练效率和低精度稳定性。其经验也包含反直觉结果:更严格的数据筛选可能减少样本却改善整体表现,过多长思维链数据可能损害指令遵循,Agent数据也不能脱离通用能力单独训练。
意义与局限
ZGCM-1的价值,首先在于把大模型训练从“最终分数”拉回到可复现的工程过程;其次,它提供了一个观察AI4AI的案例:Agent可以显著放大少数研究者的执行能力,但还不能替代研究判断。团队已开始尝试更大规模模型,未来真正值得观察的,是这套协作方式在400B、500B级别上能否继续稳定工作。
来源:量子位
评论
正在确认登录状态……
正在加载评论……