返回文章列表
推理与部署

FlashPrefill V2:把长上下文稀疏注意力推进到实际部署

阅读约 2 分钟

长上下文能力正在成为大语言模型的重要基础设施,但上下文越长,注意力计算的成本增长越快。尤其在预填充阶段,系统需要一次性处理大量输入 token,标准注意力的二次复杂度会显著推高计算和服务延迟。FlashPrefill V2 的目标,是把此前偏算法原型的稀疏注意力方案进一步改造成能够进入实际推理系统的后端组件。

这次升级解决了什么

FlashPrefill 的基本思路是快速发现注意力模式,再利用动态阈值筛选需要计算的区域,从而将稠密注意力转化为块稀疏计算。但在极高稀疏率下,近似误差和工程执行效率仍是落地障碍。V2 主要从三个方面推进:

  • 加入均值校正项。 新的校正机制用于抑制稀疏近似带来的误差,使模型在更激进的稀疏程度下仍能控制性能退化。素材并未给出具体任务上的精度变化,因此这一点更适合被理解为算法稳定性改进,而不是无条件的质量保证。
  • 重写稀疏注意力算子。 实现采用 PackGQA 内存访问、warp 专门化和乒乓流水线等设计,目标是让数据搬运、计算与 GPU 执行单元之间的配合更高效,并与 FlashAttention-3/4 的实现方向保持一致。同时,V2 支持 FP8 推理,覆盖实际部署中常见的低精度场景。
  • 接入现代服务形态。 系统原生支持分页 KV Cache 与连续批处理,因此不再局限于单次、静态的实验设置,而是可以作为 SGLang 等推理框架中的注意力后端使用。

性能信号与解读

论文在 NVIDIA H20 GPU 上进行了评估。对于 128K 上下文长度,FlashPrefill V2 相比 FlashAttention-2,在 FP8 精度下最高报告 47.26 倍加速,在 BF16 精度下最高报告 27.19 倍加速。这里的“最高”意味着结果取决于具体配置和测试条件,不能直接等同于所有模型、批大小或服务负载下的固定收益;素材也没有提供完整的测试矩阵和质量评估细节。

意义与局限

这项工作的价值不只在于提出一种稀疏模式,更在于把近似算法、GPU 内核和推理服务接口放到同一个设计中。对长文档分析、代码仓库处理等输入密集型任务而言,预填充阶段的效率改善可能直接影响首 token 延迟和硬件利用率。另一方面,稀疏注意力的收益仍取决于注意力模式、上下文长度、精度设置及工作负载,部署前仍需要验证模型质量、尾延迟和不同批处理策略下的实际表现。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Ramp推出AI模型路由服务Router,瞄准企业推理成本与模型切换
推理与部署
cctest.ai
推理与部署

Ramp推出AI模型路由服务Router,瞄准企业推理成本与模型切换

企业支出管理平台Ramp推出AI模型路由服务Router,通过统一API连接多家大模型,并提供按成本、性能和难度分配请求的策略。该服务目前仅在美国开放,2026年剩余时间免收路由服务费,但模型推理费用仍由用户承担。

阅读全文
CCTest · Blog
退役 GPU 还能做什么?DumpsterCluster 探索用二手硬件运行 LLaMA-70B
推理与部署
cctest.ai
推理与部署

退役 GPU 还能做什么?DumpsterCluster 探索用二手硬件运行 LLaMA-70B

牛津大学研究团队用 128 张二手 GPU 搭建 DumpsterCluster,验证了退役硬件服务大模型推理的可行性。研究同时指出,低采购成本并不等于低总成本,电价与电力碳强度将决定这类方案是否真正划算。

阅读全文