Loop Scaling Laws:为循环 MoE 找到联合扩展规律
导语
大模型扩展不只有“堆更多参数”这一条路。循环 Transformer 可以让同一组参数被重复执行,以较少的参数增加计算深度;混合专家模型(MoE)则只激活部分专家,在控制单次计算量的同时扩大模型的总容量。过去的扩展规律通常分别研究这两种方法,难以回答一个实际问题:如果把循环机制放进 MoE,模型究竟应该循环多少次,稀疏度又会如何影响收益?
Meta 研究团队在论文《Scaling Laws for Looped Mixture of Experts》中提出 Loop Scaling Laws,尝试统一描述循环、稀疏性、模型规模与数据之间的关系。
核心要点
- 把两条效率路径放进同一模型。 循环主要增加计算深度,MoE 稀疏性主要扩大总参数容量;新规律不再把二者割裂处理。
- 用有效参数增益描述循环收益。 论文引入有界、依赖稀疏性的循环映射,用来刻画循环执行带来的等效容量提升,并描述收益何时趋于饱和。
- 兼容已有扩展规律。 在特定条件下,这套方法可以退化为标准稠密模型和 MoE 的扩展规律,因此并非完全另起炉灶。
- 面向实际约束进行设计。 拟合后的规律可用于在训练计算量和显存限制下选择循环次数、模型规模与稀疏配置。
- 两个维度的收益并不相同。 摘要报告称,稀疏化带来约 3 倍的激活参数效率,循环在推理任务上带来约 2 倍的总参数效率;二者结合后进一步改善性能前沿。
意义与影响
这项工作的关键价值,不只是提出一个新的公式,而是把“参数容量”和“计算深度”放到同一个设计空间中。对 MoE 而言,增加专家数量会提高总容量,却不一定等比例增加每个 token 的计算;对循环模型而言,重复计算可以提升处理深度,但循环次数过多也可能出现边际收益下降。一个能够描述饱和效应的规律,有助于避免仅凭经验选择架构。
摘要还指出,在万亿 token 规模的训练中,依据该规律选择循环配置的 MoE,在匹配训练计算量的条件下,推理基准表现可接近参数规模约为其两倍的非循环 MoE。同时,循环机制天然提供了测试时继续增加计算的空间。不过,这些结论仍应结合具体任务、路由策略、硬件效率和训练稳定性理解,不能简单等同于所有模型都能获得相同比例的收益。
从研究方向看,Loop Scaling Laws 为循环模型与稀疏模型的联合设计提供了可量化框架,也提示未来的扩展不必只沿着“更大模型”推进:在总参数、激活计算和测试时预算之间重新分配资源,可能成为构建高效推理模型的重要路径。
评论
正在确认登录状态……
正在加载评论……