返回文章列表
推理与部署

Wavefront Decoding:让循环语言模型的推理解码“并行起来”

阅读约 3 分钟

导语:循环结构的效率悖论

循环语言模型通过反复应用同一个权重共享模块来增加有效计算深度,因此无需按深度线性增加参数量。但在生成阶段,每产生一个 token,模型都可能需要连续执行多次循环模块调用,计算质量与推理延迟之间形成明显矛盾。WaveFront Decoding(WFD)针对的正是这一瓶颈:它不改变模型训练过程,而是重新安排解码时不同 token 和不同循环深度的计算。

核心方法:把草拟与验证放进同一条流水线

传统自推测解码通常分成两个阶段:先由较快的草拟器生成若干候选,再由目标模型统一验证。WFD利用循环模型自身的两个特点改造这一流程:

  • 中间循环输出可用于草拟。 一个 token 尚未完成全部循环时得到的中间状态,也能产生有效的下一 token 预测,因此可以承担轻量草拟角色。
  • 权重共享适合批处理。 不同 token 位置、不同循环深度的状态都经过同一个模块,因而可以在一次批量循环调用中共同处理。
  • 采用对角波前调度。 WFD持续让新位置从浅层开始草拟,同时把较早位置推进到更深循环,直至完成全深度验证。这样,草拟和验证不是前后分离,而是在同一系列循环调用中并行交错进行。
  • 拒绝候选时使用全深度结果修正。 如果浅层草拟没有通过验证,系统用完整循环深度得到的预测进行纠正,从而保持解码流程的正确性目标。

这种设计的关键不只是“批量执行更多状态”,而是把原本沿 token 位置和循环深度展开的串行计算,重新排成类似波前的依赖关系。只要某些状态已经具备继续推进的条件,就能与其他位置的浅层计算共同进入下一次模块调用。

实验结果与工程优化

根据论文摘要,WFD在六类Spec-Bench任务上进行评估。相对于自回归解码,Ouro-2.6B获得2.42倍加速,Huginn-3.5B获得3.54倍加速,并且整体优于阶段式的draft-then-verify方案。论文还引入跨循环KV共享,以减少波前调度带来的KV流量;在Huginn-3.5B上,报告的最高加速比提升至4.81倍。

需要注意的是,这些数字来自论文摘要所述的特定模型、任务和实现设置,不能直接视为所有循环语言模型或部署硬件上的普遍收益。项目代码已公开,实际效果仍需结合模型结构、批大小、上下文长度和内存带宽进行验证。

意义与影响

WFD说明,循环模型的重复计算也可以成为推理解码优化的结构基础:中间状态不必全部等待最终深度,权重共享则为跨位置、跨深度的批处理提供了条件。相比额外训练一个独立草拟模型,这种训练免费的方案更贴近现有循环模型部署。不过,它的价值也依赖于中间输出的草拟质量、波前调度的实现复杂度以及KV缓存管理效率。随着循环式架构继续探索,如何把模型内部的深度维度转化为可调度的并行资源,可能会成为推理系统设计的重要方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
让 Prefill 与 Decode 各用一套量化方案:DQ 如何兼顾速度与精度
推理与部署
cctest.ai
推理与部署

让 Prefill 与 Decode 各用一套量化方案:DQ 如何兼顾速度与精度

一项名为 Disaggregated Quantization 的方法,针对 LLM 推理中的 Prefill 和 Decode 阶段分别设计计算格式、权重与存储策略。在 Qwen 3、Gemma 3 等模型上的实验显示,它有望同时改善低比特推理精度与首 token 延迟。

阅读全文