vLLM 首日支持 Kimi K3:2.8T MoE 模型如何被高效跑起来
导语
Kimi K3 权重公开后,vLLM 同步宣布提供 day-0 推理服务支持。相比“能加载模型”,这次更新更关键的地方在于:vLLM 试图把一个 2.8 万亿参数、百万 token 上下文、混合注意力架构的开源权重模型,整理成可运行、可扩展、可进入生产环境的服务方案。
核心要点
- 模型规模与架构更复杂:Kimi K3 是 2.8T 参数的 Mixture-of-Experts 模型,每个 token 从 896 个专家中激活 16 个,并具备原生视觉能力。它采用 Kimi Delta Attention、Attention Residuals、LatentMoE 和 MXFP4 权重,以降低超长上下文和专家计算的部署压力。
- 百万 token 上下文依赖混合缓存:Kimi K3 并非单纯使用标准 Transformer 注意力。其多数层使用带固定递归状态的 KDA,同时穿插完整注意力层。vLLM 因此设计了混合 KV 缓存管理器,在同一调度框架下同时管理完整注意力的分页 KV 块和 KDA 的递归状态块。
- 前缀缓存被重新处理:传统前缀缓存主要围绕逐 token KV 展开,而 KDA 的递归状态不能在每个可能前缀边界都保存完整快照。vLLM 的做法是将较大的物理 KDA 状态块与细粒度前缀匹配解耦,在块内登记状态快照,并在继续生成前复制可复用状态,从而让长共享提示词也能复用 KDA 与分页 KV。
- 投机解码提升单用户速度:vLLM 支持 Inferact 开源的 Kimi K3 DSpark speculator。官方素材显示,在 16 张 NVIDIA GB300 NVL72 GPU 上,未启用投机解码时为 118 tok/s,启用 DSpark 后达到 370 tok/s,约 3.14 倍提升。
- 面向生产特性较完整:此次支持包括预填充/解码分离、Mooncake 的 agentic KV caching、工具调用、reasoning 输出、结构化输出,并覆盖 NVIDIA Hopper、Blackwell 以及 AMD MI355X。当前由于依赖复杂,官方强调主要通过 Docker 镜像使用。
意义与影响
Kimi K3 对推理框架提出的挑战,不只是“参数更大”。它把 MoE、线性/递归注意力、超长上下文、4-bit 权重、投机解码和多模态输入放在同一个服务路径里,任何一个环节没有适配好,实际吞吐和可用性都会受影响。
因此,vLLM 的 day-0 支持更像是一次推理系统能力展示:框架需要理解模型结构,而不只是调用通用算子。混合前缀缓存尤其值得关注,因为它把面向标准注意力模型的缓存思路扩展到了带递归状态的混合线性模型。vLLM 表示,这部分核心改动也将惠及类似架构的其他模型。
对企业和开发者来说,短期价值在于降低尝试 Kimi K3 的门槛;长期看,随着更多超长上下文、稀疏专家和非标准注意力模型出现,推理框架的竞争重点会从“支持多少模型”转向“能否为新架构快速做出高效服务路径”。
来源:vLLM Blog
评论
正在确认登录状态……
正在加载评论……