返回文章列表
记忆与上下文

DeepSeek-V4.1-Flash:把长上下文成本压到 KV 缓存

阅读约 3 分钟

导语

长上下文模型的瓶颈,已经不只是“能不能读得更长”,还包括这些上下文需要怎样被计算、保存和搬运。对于需要持续调用工具、反复读取历史记录的长周期智能体而言,输入往往远多于输出。此时,预填充阶段的计算成本,以及 KV 缓存对显存、主机内存、SSD 和数据传输带宽的占用,都会直接影响部署价格。

DeepSeek-V4.1-Flash 的设计重点,正是把 KV 缓存压缩放在模型和系统协同优化的核心位置。论文介绍的模型是一个多模态 MoE,骨干参数量为 552B,最长支持一百万 token 上下文。

核心要点

  • 针对不同阶段分配计算量。 模型采用 Causal Encoder-Decoder(CED)架构。预填充阶段每个 token 激活 8B 参数,解码阶段激活 16B 参数。这样的配置针对智能体“输入很长、输出相对有限”的工作模式,试图降低处理历史上下文的成本。
  • 压缩始终驻留 HBM 的缓存。 DeepSeek-V4.1-Flash 在 Compressed Sparse Attention 2(CSA2)中引入跨层 KV 缓存复用,并结合 FP4 精度的 KV 缓存。论文给出的结果是,全局 KV 缓存占用降至每 token 890 字节,约为 DeepSeek-V4-Flash 对应占用的四分之一。
  • 减少外部存储中的持久化缓存。 对于不一直放在 HBM、而是位于 SSD 或主机内存中的缓存,系统采用 SWA Bounded Replay 部署优化。论文称,这部分持久化 KV 缓存约降至基线的八分之一。
  • 压缩并未被描述为单纯的取舍。 素材称,新模型在缓存规模明显更小的同时,相比 DeepSeek-V4-Flash 取得了更好的整体表现,并通过多模态语料预训练和后训练覆盖文本及多模态智能体场景。

意义与影响

这项工作的价值不只在于一个更小的缓存数字,而在于它把推理成本拆成了三个相互关联的问题:预填充计算、HBM 中的即时缓存,以及 SSD 或主机内存中的持久化缓存。过去,只优化其中一环,往往会把压力转移到另一环;而 CED、注意力机制、低精度缓存和部署策略的组合,体现了从模型结构到系统实现的联合设计思路。

对长周期智能体来说,缓存容量和带宽决定了能够同时服务多少会话,也影响历史轨迹、工具结果和多模态输入能否被持续保留。若论文中的比例能够在实际硬件和工作负载中稳定复现,KV 缓存压缩有望成为降低长上下文部署成本的重要路径。不过,现有素材主要给出了架构和相对结果,尚未提供完整的硬件配置、延迟、吞吐、精度损失及不同任务的详细对比。因此,模型的实际收益仍需结合原文实验和具体服务场景评估。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章