返回文章列表
记忆与上下文

xHC:把 Transformer 残差流扩展到 N=16 的新路径

阅读约 2 分钟

导语

大模型扩展通常围绕参数量、层数、宽度、数据量和计算量展开。xHC 这篇论文把注意力放到了一个更细的结构位置:Transformer 的残差流。此前 Hyper-Connections(HC)提出将残差流扩展为 N 条并行流,相当于在模型内部增加一类“记忆容量”。但在已有 HC 系列方法中,实践上常常停在 N=4。xHC 的目标,就是回答一个直接的问题:残差流宽度能否继续扩大,并在大规模语言模型预训练中真正带来收益?

核心要点

  • 问题不在概念,而在可扩展性。 HC 从 N=1 到 N=4 的收益提示残差流扩展可能是一条新的 scaling axis;但作者实验发现,mHC 继续扩大 N 后,性能收益变小,训练成本却快速增加。
  • 两类瓶颈限制了大 N。 第一,随着残差流数量变多,写回到各条流的信息不足;第二,残差混合生成的成本随 N 呈三次方增长,使大规模训练变得不划算。
  • xHC 的改动是“看全局、少更新”。 它引入 temporal feature augmentation,为写回提供更丰富的时间特征;同时采用稀疏残差流结构,在 N=16 的设置下每次只更新 k=4 条流,但仍保留对完整残差状态的密集访问。
  • 实验收益集中在大模型预训练。 在 18B MoE 模型上,xHC 将最终训练 loss 从 mHC 的 1.776 降到 1.758,平均下游分数从 44.8 提升到 48.8;训练 FLOPs 相比 vanilla baseline 仅增加 4.1%。在 28B MoE 上,xHC 也比 mHC 高出 3.1 个平均分。
  • 计算效率是论文的重要卖点。 scaling-law 结果显示,为达到相同 loss,vanilla 和 mHC 分别需要 xHC 的 1.50 倍和 1.19 倍计算量。作者还提出 xHC-Flash,将每个子层的内存流量从 73.5C 降到 40C,接近 N=4 mHC 的 34C。

意义与影响

xHC 的价值在于,它不是简单宣称“更多残差流更好”,而是指出为什么 mHC 难以越过 N=4,并用稀疏更新来避免大 N 带来的计算爆炸。这使残差流扩展从一个结构想法更接近可训练、可部署的工程方案。

如果结果能在更多架构和训练设置中复现,残差流宽度可能成为继模型宽度、深度、MoE 专家数量之外的又一条扩展维度。尤其对大规模 MoE 预训练而言,xHC 提供了一种在较小额外 FLOPs 下提升表示容量的路线。不过,当前材料主要展示论文自身实验,外部复现、不同模型族上的稳定性,以及与其他效率优化方法的组合效果,仍需要后续验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
把验证知识“嫁接”进 KV Cache:小模型也能变成可复用知识飞轮?
记忆与上下文
cctest.ai
记忆与上下文

把验证知识“嫁接”进 KV Cache:小模型也能变成可复用知识飞轮?

一篇新论文提出用字节级精确的 KV Cache 嫁接,把已经验证过的知识保存为状态工件,并在后续推理中恢复到冻结小模型里。它的亮点是极低重复推理成本,但也面临可复现性与“能力提升”定义的争议。

阅读全文
CCTest · Blog
KV Cache 也会“偏心”:新论文揭示长上下文推理中的结构角色偏差
记忆与上下文
cctest.ai
记忆与上下文

KV Cache 也会“偏心”:新论文揭示长上下文推理中的结构角色偏差

一篇 arXiv 新论文指出,按注意力累计值淘汰 KV Cache 的方法,在嵌套 JSON 等结构密集文本上可能错误保留大量“结构噪声”。作者提出无需重训的角色条件分配策略,用较小额外开销缓解这一问题。

阅读全文