返回文章列表
记忆与上下文

ALiBi 位置编码的“失明”问题:长距离注意力可能被数值精度吞掉

阅读约 2 分钟

导语

ALiBi(Attention with Linear Biases)是一类常用于提升 Transformer 长上下文泛化能力的位置编码方法。它不为位置单独学习嵌入,而是在注意力分数中加入随距离线性变化的偏置,让模型天然倾向于关注近处 token。新论文《When Attention Goes Blind》提醒我们:这种看似简单稳健的设计,在实际浮点计算中可能存在一个隐蔽的数值陷阱。

核心要点

  • 问题来自数值下溢:ALiBi 的线性偏置会随着距离增大而持续缩放。当偏置过强时,经过 softmax 后的部分注意力权重可能低于浮点精度可表示范围,最终被压成 0。
  • 注意力头会“部分失明”:一旦大量远距离位置的权重归零,受影响的注意力头就不再只是“较少关注”远处信息,而是几乎无法从这些位置读取内容。
  • 常规基准不一定能发现问题:论文指出,这种失效会显著削弱 token 检索能力,尤其是需要在长上下文中找回特定信息的任务;但在标准解码器评测上,它的影响可能较小,因此容易被忽视。
  • 作者做了预训练层面的验证:研究不仅分析了失效机制,还在基于 ALiBi 的先进预训练模型中观察到这一现象,并通过 148M 参数解码器模型的预训练实验,区分它与一般长上下文退化之间的关系。
  • 缓解策略中,对数距离缩放更稳定:论文评估了四种训练时缓解方案及其组合,发现使用 log-scaled distances 在 passkey retrieval 上带来最一致的改进。

意义与影响

这项工作的重要性在于,它把长上下文模型中的一个性能问题从“模型能力不足”具体定位到了“数值表示失效”。如果注意力权重已经被下溢成零,那么再期待模型通过训练学会利用这些位置,就会变得不现实。

不过,论文也没有简单否定 ALiBi。相反,作者发现默认 ALiBi slopes 仍然是相当强的基线,尤其在 needle-in-a-haystack 检索中表现仍有竞争力。这意味着问题并非“ALiBi 不能用”,而是训练和部署长上下文模型时,需要更谨慎地检查注意力数值范围、距离缩放方式和检索型评测。

对模型开发者而言,这篇论文给出的启示很直接:仅看常规语言建模或解码器基准,可能无法暴露长上下文读取能力的缺陷;如果使用 ALiBi,应加入 passkey、needle-in-a-haystack 等检索任务,并考虑训练时采用更稳健的距离缩放方案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章