Qwen3.8-Next架构解读:把效率、能力与稳定性放进同一张设计表
导语
大模型架构的竞争,已经不只是“参数越多越强”。Qwen团队在论文中系统拆解了Qwen3.8-Flash-Next的设计取舍,试图回答一个更现实的问题:如何在减少计算的同时,尽量保住模型能力,并让训练过程更稳定。
核心要点
- 稀疏激活承担主要容量。 该模型总参数量为125B,但每个token约激活6B参数;另有51B参数的n-gram嵌入表放在加速器之外,并在需要时从主机内存预取。这样做把部分容量从主干网络中“外置”,避免所有参数都持续占用加速器资源。
- 混合token mixing。 预训练阶段将Gated DeltaNet(GDN)与全局注意力按层组合,每四层安排一层完整注意力。在持续预训练阶段,这些完整注意力层会改用Qwen Sparse Attention(QSA),通过轻量级压缩索引器,以微块为粒度筛选上下文,目标是在长上下文建模能力与计算开销之间取得平衡。
- 残差流扩展为四路。 新设计Gated Residual(GR)将残差表示拓宽为四个分支,再通过逐元素门控读取。论文将其视为提升表达能力和控制信息流的一种结构化方式,而不是简单堆叠参数。
- 消融不只看loss。 研究同时评估训练损失、下游基准、训练与推理成本,以及候选设计对最优超参数和稳定性的影响。一个关键观察是,扩大n-gram词表可以持续降低损失,但下游准确率会逐渐饱和,说明训练指标与实际任务表现并非总是同步。
结果与意义
在14项预训练基准上,Qwen3.8-Flash-Next有8项超过397B-A17B前代模型,其余项目最多落后2.6个百分点。与此同时,它使用约三分之一的激活参数和训练token,训练FLOPs约为前代的九分之一。这里的重点并非单一模块带来的“魔法提升”,而是稀疏专家、混合token mixing、外置嵌入和残差门控共同形成的系统性折中。
论文还把优化器纳入架构讨论:模型结构与Muon优化器配合后,最优学习率和批大小整体上移,也不再需要批大小预热,并在压力测试中表现出更强稳定性。对大模型研发而言,这意味着评估标准需要从“谁的loss更低”扩展到“同等能力需要多少计算、推理代价和调参风险”。
这项工作暂时不能被简单解读为某个组件适用于所有模型。它更重要的价值,是展示了一种联合设计方法:把训练、预填充、解码、下游任务和稳定性放在同一张成本收益表中衡量。对于追求更高效大模型的团队,这种方法可能比单独追逐参数规模更具参考意义。
评论
正在确认登录状态……
正在加载评论……