返回文章列表
大语言模型

Skaling 法则:把模型规模与数据量放回同一个公式里

阅读约 2 分钟

导语

大模型训练越来越像一门“预算科学”:在真正投入巨额算力之前,研究者需要判断多大的模型、多少训练数据、怎样的训练时长最划算。神经缩放定律正是为此服务的工具,它用相对简单的函数预测模型损失随参数量和数据量变化的趋势。Hugging Face Daily Papers 收录的论文《Skaling: Chinchilla's Exponents Meet Kaplan's Coupling》关注的,正是这些公式在边界条件下不够可靠的问题。

核心要点

  • 传统假设可能过于简单。 论文认为,常见缩放定律通常把模型规模和训练数据对损失的影响分开建模,默认二者近似独立。但在数据很少或训练明显超过常规配比时,这种独立性假设会导致系统性低估或高估损失。
  • Skaling law 引入耦合项。 研究提出一种更一般的函数形式,用一个“交互指数”描述模型容量与数据之间的相互作用。换句话说,它不再只问“模型变大多少”或“数据增加多少”,而是把二者组合后的影响纳入同一表达式。
  • 预测误差显著下降。 摘要显示,Skaling law 在插值和外推两类场景中,将平均绝对百分比误差(MAPE)降低了 1.5 到 3 倍。这意味着它不仅对已覆盖实验网格内的点更贴合,也更有希望从小实验推断更大规模训练结果。
  • 低算力稀疏网格更高效。 论文还将该法则与限制在低计算区域的稀疏网格策略结合,用约 10 倍更少的计算量,实现对完整实验网格的较准确外推。

意义与影响

如果结论在更多模型族、数据集和训练配方中成立,Skaling law 的价值并不只是“拟合得更好”。它可能改变团队做预训练决策的方式:先在小规模、低成本区域采样,再用更可靠的外推模型选择大规模训练配置。这对于算力预算紧张的机构尤其重要,因为一次错误的规模选择可能意味着大量 GPU 时间和数据处理成本被浪费。

同时,这项工作也提醒行业,缩放定律不是永远稳定的经验公式。随着训练策略进入数据稀缺、长时间训练或非标准配比区间,模型容量与数据之间的互动会变得更关键。Skaling law 用一个额外指数保留了公式的简洁性,又试图弥补原有框架在极端区域的盲点。它为下一代语言模型训练提供了一个更稳健的预算分配思路,但其普适性仍需要更多公开复现实验来检验。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章