返回文章列表
开源生态

Puro-2B:用消费级 RTX 5090 将 2B 模型预训练成本压到约 5090 美元

阅读约 2 分钟

导语

大语言模型预训练通常被高昂的算力和数据成本挡在研究机构与个人开发者之外。清华大学 PACMAN Group 发布的 Puro-2B,试图回答一个更务实的问题:如果只使用消费级 GPU,能否以几千美元的预算训练出具备竞争力的 2B 级模型?

核心要点

  • 面向消费级硬件。 Puro-2B 使用 RTX 5090,并采用 FP8 低精度训练,以降低计算与显存压力。
  • 从零开始训练。 研究团队训练了一组不同版本的 Puro-2B,训练规模最高达到 1.4 万亿 tokens,而不是仅对已有模型进行微调。
  • 配方不只依赖硬件。 方法组合包括 Hyperball 优化、课程式模型平均,以及针对预训练数据的处理与组织方案。论文强调,成本下降来自这些环节的协同,而非单一技巧。
  • 成本与性能存在梯度。 最佳模型的计算成本低于 6900 美元,在研究团队的评测协议下接近 Qwen2.5-1.5B。基于整个模型集合拟合的 Puro Cost Scaling Law 则推测,约 4400 美元可能达到 Qwen2-1.5B 的平均评测表现。
  • 完整开放。 项目计划以 Apache 2.0 发布训练数据、代码和模型权重,为复现实验和后续研究提供基础。

这项工作的意义

Puro-2B 的价值不在于宣称消费级 GPU 已经取代大规模集群,而在于把“训练一个基础模型”拆解成可被公开检验的工程流程。过去,许多开源项目主要开放权重或训练框架,研究者仍难以复现数据筛选、训练稳定性和成本控制过程。Puro-2B 将这些环节放到同一条开放管线上,降低了小规模团队研究预训练策略的门槛。

成本缩放规律也提供了一个有用的分析视角:模型性能并非只有“训练或不训练”两种选择,预算、token 数量和配方变体之间可以进行更细致的权衡。不过,4400 美元是基于该模型集合和评测协议得到的拟合结果,并不等同于对所有任务或硬件环境的保证;训练数据质量、GPU 租赁价格、能耗、人工投入以及评测覆盖范围,都可能影响最终结论。

更值得关注的是,团队还把预训练数据课程与后训练后的下游表现联系起来。由于研究者掌握完整训练流程,他们可以研究数据顺序和配方变化如何影响最终能力,而不仅是比较几个已经完成的模型。对开源社区而言,这种可复现、可拆解的训练案例,或许比单个模型的分数更具长期价值。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章