返回文章列表
大语言模型

Loop Scaling Laws:为循环 MoE 找到联合扩展规律

阅读约 3 分钟

导语

大模型扩展不只有“堆更多参数”这一条路。循环 Transformer 可以让同一组参数被重复执行,以较少的参数增加计算深度;混合专家模型(MoE)则只激活部分专家,在控制单次计算量的同时扩大模型的总容量。过去的扩展规律通常分别研究这两种方法,难以回答一个实际问题:如果把循环机制放进 MoE,模型究竟应该循环多少次,稀疏度又会如何影响收益?

Meta 研究团队在论文《Scaling Laws for Looped Mixture of Experts》中提出 Loop Scaling Laws,尝试统一描述循环、稀疏性、模型规模与数据之间的关系。

核心要点

  • 把两条效率路径放进同一模型。 循环主要增加计算深度,MoE 稀疏性主要扩大总参数容量;新规律不再把二者割裂处理。
  • 用有效参数增益描述循环收益。 论文引入有界、依赖稀疏性的循环映射,用来刻画循环执行带来的等效容量提升,并描述收益何时趋于饱和。
  • 兼容已有扩展规律。 在特定条件下,这套方法可以退化为标准稠密模型和 MoE 的扩展规律,因此并非完全另起炉灶。
  • 面向实际约束进行设计。 拟合后的规律可用于在训练计算量和显存限制下选择循环次数、模型规模与稀疏配置。
  • 两个维度的收益并不相同。 摘要报告称,稀疏化带来约 3 倍的激活参数效率,循环在推理任务上带来约 2 倍的总参数效率;二者结合后进一步改善性能前沿。

意义与影响

这项工作的关键价值,不只是提出一个新的公式,而是把“参数容量”和“计算深度”放到同一个设计空间中。对 MoE 而言,增加专家数量会提高总容量,却不一定等比例增加每个 token 的计算;对循环模型而言,重复计算可以提升处理深度,但循环次数过多也可能出现边际收益下降。一个能够描述饱和效应的规律,有助于避免仅凭经验选择架构。

摘要还指出,在万亿 token 规模的训练中,依据该规律选择循环配置的 MoE,在匹配训练计算量的条件下,推理基准表现可接近参数规模约为其两倍的非循环 MoE。同时,循环机制天然提供了测试时继续增加计算的空间。不过,这些结论仍应结合具体任务、路由策略、硬件效率和训练稳定性理解,不能简单等同于所有模型都能获得相同比例的收益。

从研究方向看,Loop Scaling Laws 为循环模型与稀疏模型的联合设计提供了可量化框架,也提示未来的扩展不必只沿着“更大模型”推进:在总参数、激活计算和测试时预算之间重新分配资源,可能成为构建高效推理模型的重要路径。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
NCP-ArchPreview:让语言模型从预测下一个词走向预测下一个概念
大语言模型
cctest.ai
大语言模型

NCP-ArchPreview:让语言模型从预测下一个词走向预测下一个概念

NCP-ArchPreview在传统下一词预测之外,引入覆盖多个词元的下一概念预测,将离散概念空间纳入语言模型训练。技术报告显示,该8.9B参数模型在更少训练词元和计算量下取得了具有竞争力的预训练与下游表现。

阅读全文