返回文章列表
推理与部署

vLLM 引入并行草稿解码:P-EAGLE、DFlash 与 DSpark 如何突破单 Token 生成瓶颈

阅读约 3 分钟

导语

推测解码已经成为大模型推理服务中的重要优化手段:先由较小或专门设计的草稿模型提出多个候选 token,再由主模型在一次前向计算中验证,从而缓解内存带宽瓶颈并提升吞吐。vLLM Blog 最新介绍的重点,是 Speculators 与 vLLM 对 P-EAGLE、DFlash、DSpark 三种并行草稿算法的开源支持。这些方法不再让草稿模型逐个 token 递归生成,而是尝试一次性预测一段候选块。

核心要点

  • 传统推测解码的瓶颈在草稿阶段:EAGLE、MTP 等方法让草稿模型利用验证模型的隐藏状态,显著提升候选 token 的命中率。但 EAGLE-3 这类先进方案仍然依赖自回归草稿生成:要生成 K 个候选 token,就需要按顺序执行多步草稿推理。
  • 并行草稿把成本与长度部分解耦:P-EAGLE、DFlash、DSpark 的共同方向,是在单次草稿前向过程中预测一整个候选块。这样一来,草稿阶段的延迟不再随候选长度线性增长,工程团队也不必频繁围绕 K 值做细粒度调参。
  • P-EAGLE 延续 EAGLE 思路:它直接使用验证模型隐藏状态作为输入特征,并把这些特征映射到多个未来位置。训练时通过 draft block sparsification 降低 lookahead 维度上的损失计算压力,把优化重点放在更近的未来 token 上。
  • DFlash 改变了特征注入方式:它不是把隐藏状态拼入输入序列,而是投影后注入草稿模型的 KV-cache,让注意力机制直接受验证模型状态调节。训练上则采用 sequence length sparsification,只在随机锚点计算块预测损失,以节省显存和计算。
  • DSpark 在 DFlash 基础上增加筛选与修正:它加入轻量自回归校正头,改善未来 token 与已生成 token 的一致性;同时使用置信度头提前评估候选 token,尽量只把更可能被接受的 token 交给验证模型,减少无效验证开销。

意义与影响

并行草稿的价值不只在“更快”。它改变了推测解码的部署约束:草稿模型可以更有表达力,候选块长度的选择也可能不再像传统自回归草稿那样敏感。对线上服务而言,这意味着在不同任务、模型和硬件负载下,推理优化策略有机会变得更简单、更稳定。

不过,vLLM Blog 也没有给出一个适用于所有场景的固定结论。文中展示了 Qwen3-8B 搭配 P-EAGLE、Qwen3-30B-A3B 搭配 DFlash、gemma-4-31B-it 搭配 DSpark 的案例,并指出相较 EAGLE-3 有明显提升,但实际性能仍会随任务、模型和硬件配置变化。换言之,并行草稿更像是推理服务栈中的新一代工具箱,而不是无需评测即可套用的万能开关。

对于关注 LLM serving 的团队,这次更新值得留意:它把推测解码的讨论从“如何让小模型猜得更准”,推进到“如何让候选生成本身摆脱串行结构”。如果相关实现能在更多模型与负载下保持稳定收益,并降低训练与部署复杂度,并行草稿可能会成为未来高吞吐大模型服务的常见组成部分。

来源:vLLM Blog

评论

正在确认登录状态……

正在加载评论……

相关文章