返回文章列表
大语言模型

Qwen3.8-Next架构解读:把效率、能力与稳定性放进同一张设计表

阅读约 3 分钟

导语

大模型架构的竞争,已经不只是“参数越多越强”。Qwen团队在论文中系统拆解了Qwen3.8-Flash-Next的设计取舍,试图回答一个更现实的问题:如何在减少计算的同时,尽量保住模型能力,并让训练过程更稳定。

核心要点

  • 稀疏激活承担主要容量。 该模型总参数量为125B,但每个token约激活6B参数;另有51B参数的n-gram嵌入表放在加速器之外,并在需要时从主机内存预取。这样做把部分容量从主干网络中“外置”,避免所有参数都持续占用加速器资源。
  • 混合token mixing。 预训练阶段将Gated DeltaNet(GDN)与全局注意力按层组合,每四层安排一层完整注意力。在持续预训练阶段,这些完整注意力层会改用Qwen Sparse Attention(QSA),通过轻量级压缩索引器,以微块为粒度筛选上下文,目标是在长上下文建模能力与计算开销之间取得平衡。
  • 残差流扩展为四路。 新设计Gated Residual(GR)将残差表示拓宽为四个分支,再通过逐元素门控读取。论文将其视为提升表达能力和控制信息流的一种结构化方式,而不是简单堆叠参数。
  • 消融不只看loss。 研究同时评估训练损失、下游基准、训练与推理成本,以及候选设计对最优超参数和稳定性的影响。一个关键观察是,扩大n-gram词表可以持续降低损失,但下游准确率会逐渐饱和,说明训练指标与实际任务表现并非总是同步。

结果与意义

在14项预训练基准上,Qwen3.8-Flash-Next有8项超过397B-A17B前代模型,其余项目最多落后2.6个百分点。与此同时,它使用约三分之一的激活参数和训练token,训练FLOPs约为前代的九分之一。这里的重点并非单一模块带来的“魔法提升”,而是稀疏专家、混合token mixing、外置嵌入和残差门控共同形成的系统性折中。

论文还把优化器纳入架构讨论:模型结构与Muon优化器配合后,最优学习率和批大小整体上移,也不再需要批大小预热,并在压力测试中表现出更强稳定性。对大模型研发而言,这意味着评估标准需要从“谁的loss更低”扩展到“同等能力需要多少计算、推理代价和调参风险”。

这项工作暂时不能被简单解读为某个组件适用于所有模型。它更重要的价值,是展示了一种联合设计方法:把训练、预填充、解码、下游任务和稳定性放在同一张成本收益表中衡量。对于追求更高效大模型的团队,这种方法可能比单独追逐参数规模更具参考意义。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
可解释性不再是性能税?Steerling-8B 探索“生来透明”的语言模型
大语言模型
cctest.ai
大语言模型

可解释性不再是性能税?Steerling-8B 探索“生来透明”的语言模型

这篇技术报告提出一种训练期可解释语言模型路线:不是在模型训练后再解释黑箱,而是把可解释性作为训练目标的一部分。其代表模型 Steerling-8B 试图在生成结果、输入 token、概念与训练数据之间建立可追溯关系。

阅读全文
CCTest · Blog
无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习
大语言模型
cctest.ai
大语言模型

无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习

这篇论文提出 U-OPSD:只利用模型自身多次生成结果的一致性来构造伪答案,并在分歧样本上进行自蒸馏。实验显示,该方法在数学推理基准上可稳定提升 Qwen3 等模型表现,并能匹敌或超过带真值监督的方法。

阅读全文