xHC:把 Transformer 残差流扩展到 N=16 的新路径
导语
大模型扩展通常围绕参数量、层数、宽度、数据量和计算量展开。xHC 这篇论文把注意力放到了一个更细的结构位置:Transformer 的残差流。此前 Hyper-Connections(HC)提出将残差流扩展为 N 条并行流,相当于在模型内部增加一类“记忆容量”。但在已有 HC 系列方法中,实践上常常停在 N=4。xHC 的目标,就是回答一个直接的问题:残差流宽度能否继续扩大,并在大规模语言模型预训练中真正带来收益?
核心要点
- 问题不在概念,而在可扩展性。 HC 从 N=1 到 N=4 的收益提示残差流扩展可能是一条新的 scaling axis;但作者实验发现,mHC 继续扩大 N 后,性能收益变小,训练成本却快速增加。
- 两类瓶颈限制了大 N。 第一,随着残差流数量变多,写回到各条流的信息不足;第二,残差混合生成的成本随 N 呈三次方增长,使大规模训练变得不划算。
- xHC 的改动是“看全局、少更新”。 它引入 temporal feature augmentation,为写回提供更丰富的时间特征;同时采用稀疏残差流结构,在 N=16 的设置下每次只更新 k=4 条流,但仍保留对完整残差状态的密集访问。
- 实验收益集中在大模型预训练。 在 18B MoE 模型上,xHC 将最终训练 loss 从 mHC 的 1.776 降到 1.758,平均下游分数从 44.8 提升到 48.8;训练 FLOPs 相比 vanilla baseline 仅增加 4.1%。在 28B MoE 上,xHC 也比 mHC 高出 3.1 个平均分。
- 计算效率是论文的重要卖点。 scaling-law 结果显示,为达到相同 loss,vanilla 和 mHC 分别需要 xHC 的 1.50 倍和 1.19 倍计算量。作者还提出 xHC-Flash,将每个子层的内存流量从 73.5C 降到 40C,接近 N=4 mHC 的 34C。
意义与影响
xHC 的价值在于,它不是简单宣称“更多残差流更好”,而是指出为什么 mHC 难以越过 N=4,并用稀疏更新来避免大 N 带来的计算爆炸。这使残差流扩展从一个结构想法更接近可训练、可部署的工程方案。
如果结果能在更多架构和训练设置中复现,残差流宽度可能成为继模型宽度、深度、MoE 专家数量之外的又一条扩展维度。尤其对大规模 MoE 预训练而言,xHC 提供了一种在较小额外 FLOPs 下提升表示容量的路线。不过,当前材料主要展示论文自身实验,外部复现、不同模型族上的稳定性,以及与其他效率优化方法的组合效果,仍需要后续验证。
评论
正在确认登录状态……
正在加载评论……