返回文章列表
大语言模型

Multi-Head Attention Residuals:让 Transformer 的残差通路也拥有多头路由

阅读约 3 分钟

导语

Transformer 的残差连接看似只是“把上一层结果加回来”,但它实际上承担着跨层传递信息的主干作用。标准结构中,每个子层主要读取最新的隐藏状态;如果较早层的信息已经被后续变换稀释,模型只能通过这一条不断更新的残差流继续向前传播。论文《Multi-Head Attention Residuals》关注的正是这个被长期默认的设计:深度方向上的信息路由是否也应该像 token 维度的注意力一样,更细粒度、更可选择?

核心要点

  • 问题来自“单一路由分布”:已有 attention residuals 让子层可以通过 learned softmax 回看不同深度的历史状态,但它使用一个跨整个宽度共享的 query。换言之,不同特征子空间即使想读取不同层,也必须共用同一套深度权重。
  • 宽模型中妥协成本更高:论文认为,模型越宽,内部特征子空间的功能分化越明显,它们对“应该读取哪一层”的偏好也更容易不一致。单一 softmax 会把这些偏好压成折中方案,从而限制表达能力。
  • MHAR 的做法很直接:Multi-Head Attention Residuals 将路由 query reshape 成 H 个面向子空间的 head,每个 head 都有自己的 softmax,用来在深度历史上选择信息。读取结构因此变成块对角形式。
  • 几乎不增加额外负担:根据摘要,MHAR 的 reshape 不增加参数,计算开销也很小;当 H=1 时,它会退化为原来的 attention residuals,因此可被看作后者的自然泛化。
  • 实验显示稳定收益:作者在去重、质量过滤、偏 STEM 和代码的 Nemotron-based anneal corpus 上从头训练模型。相对标准 Transformer,MHAR 在 100M、350M、1B 规模上分别带来 -0.061、-0.149、-0.140 的验证损失改进,并在四种方法比较中各设置下表现最好。
  • 头数不是越多越好:验证损失随 H 呈 U 形,H=4 或 H=8 附近较优;H=16 会回吐部分收益。作者在大规模模型中采用 H=8。

意义与影响

这项工作有意思之处在于,它没有重新设计注意力主干,也没有引入复杂外部记忆,而是把“多头”思想移到了残差深度路由上。对于大语言模型而言,深层网络内部不同特征可能承担语法、事实、推理、代码模式等不同功能,让它们用各自的深度读取策略,符合模型宽度扩展后的直觉。

不过,素材给出的结果仍主要来自特定训练语料和若干规模设置。MHAR 是否能在更广泛的数据配比、架构变体和训练预算下保持收益,还需要更多复现。其工程侧也并非完全免费:论文提到通过 fused Triton routing kernels 将 attention-residual 训练吞吐提升到基线的 0.55-0.88x,并保持接近基线的峰值显存,这说明高效实现仍是落地关键。

总体看,MHAR 提供了一个低参数、低侵入的 Transformer 改造方向:让残差流不再只是单条被动通道,而成为可按子空间分头选择的深度信息路由机制。对于追求训练效率和模型质量平衡的 LLM 架构研究,这是一条值得继续验证的路线。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
NCP-ArchPreview:让语言模型从预测下一个词走向预测下一个概念
大语言模型
cctest.ai
大语言模型

NCP-ArchPreview:让语言模型从预测下一个词走向预测下一个概念

NCP-ArchPreview在传统下一词预测之外,引入覆盖多个词元的下一概念预测,将离散概念空间纳入语言模型训练。技术报告显示,该8.9B参数模型在更少训练词元和计算量下取得了具有竞争力的预训练与下游表现。

阅读全文