返回文章列表
模型发布

Motif 3 技术报告:314B 参数的稀疏 MoE,押注长上下文与推理能力

阅读约 2 分钟

导语

Motif 3 的技术报告展示了一条很明确的路线:继续扩大模型能力,但尽量把计算开销压在可控范围内。它不是单纯堆参数,而是把稀疏 MoE、压缩注意力、稳定训练和多阶段后训练组合在一起,目标是在推理、代码、长上下文和专业任务上形成统一能力。

核心要点

  • 模型规模大,但激活更省:Motif 3 是 decoder-only Mixture-of-Experts 语言模型,总参数 3140 亿,每个 token 仅激活 132 亿参数。
  • 专家更细、选择更稀疏:每层包含 384 个路由专家,每个 token 只选 8 个,提升专家容量的同时限制计算量。
  • GDLA 是结构核心:Grouped Differential Latent Attention 将分组差分注意力与压缩式 key-value 表示结合,试图兼顾表达能力与效率。
  • 训练稳定性被重点处理:报告提到改造后的 manifold-constrained hyper-connections、Expert Specific PolyNorm、多 token prediction,以及专家均衡和数值稳定技巧。
  • 面向超长上下文:通过 selective MXFP8 计算与通信、内存高效 fused kernel、window-aware context parallelism,训练上下文长度可扩展到 256K token。
  • 后训练强调多能力融合:流程包括通用监督微调、6 个由强化学习训练的 specialist teacher、1 个软件工程 teacher,以及 Multi-teacher On-Policy Distillation。

这意味着什么

Motif 3 的价值不只在“模型更大”,而在于它把大模型训练中的几个关键矛盾放到一起解决:既要高容量专家网络,又要可训练、可部署、可扩展。对当下语言模型竞争来说,这类工作说明稀疏 MoE 仍然是提升能力密度的重要方向,尤其适合追求推理、编程和长上下文的场景。

另一个值得关注的点是它的后训练策略。通过多个专长教师与统一蒸馏,模型试图把不同能力收束到一个系统中,而不是让某一项能力单独变强。这种做法如果稳定有效,可能会影响后续高性能开源或开放权重模型的训练范式。

从报告披露的信息看,Motif 3 在长链路 agent 任务、数学、科学知识以及幻觉敏感评测上都有竞争力。对行业而言,这类结果表明:未来的提升不一定只来自更大算力,也可能来自更精细的结构设计和更系统的训练编排。

来源: Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章