返回文章列表
推理与部署

DLoop:让推测解码少做几次大模型验证

阅读约 3 分钟

导语

自回归大语言模型生成文本时,真正昂贵的往往不是输出一个 token,而是不断调用规模更大的目标模型。推测解码的思路是先让轻量草稿模型提出一段候选 token,再由目标模型批量验证,以较少的目标模型调用换取更高吞吐。但现有流程通常在每个草稿阶段之后立即验证,即使这一阶段产生的 token 全部正确,也不能直接继续起草。

NAVER AI Lab 的论文 DLoop: Looped Speculative Decoding 针对这一问题,将推测解码改造成一种“循环式”流程:只要草稿模型仍然具有足够信心,就继续进行下一轮草稿生成,最后把多轮累积的 token 一起交给目标模型验证。

核心要点

  • 把多轮草稿合并验证。 传统方法大致是“起草一轮、验证一轮”。DLoop 则允许在一次目标模型验证前执行多个起草阶段,从而减少昂贵的目标模型前向计算。
  • 由置信度决定是否继续。 当草稿模型对当前候选仍有信心时,系统延迟验证;一旦信心下降,再集中验证已经积累的 token。这让验证频率能够随生成状态动态变化。
  • 兼容不同类型的草稿模型。 对自回归草稿模型而言,延长草稿长度相对直接;对并行草稿模型而言,未验证 token 缺少目标模型提供的隐藏状态,继续起草更困难。DLoop 将这一限制纳入训练和推理流程。
  • 引入 loop-aware training。 训练时让草稿模型接触由自身生成、但尚未经过目标模型确认的 token 隐藏状态,帮助它适应额外的循环阶段,避免连续起草后可靠性明显下降。
  • 保持无损解码。 论文报告称,DLoop 在 EAGLE-3、DFlash、Domino、DSpark 以及多 token 预测模块等方法上均可提升墙钟速度,提升幅度为 5% 至 41%,同时保持无损解码。

意义与影响

DLoop 的价值不在于单纯扩大草稿模型,而在于重新安排“起草”和“验证”的节奏。随着草稿模型能力增强,目标模型越来越可能接受一整轮候选 token。如果仍然固定每轮验证,就会把大量计算花在重复确认上。DLoop 的策略是把这些高概率正确的阶段串联起来,把目标模型调用集中到更有必要的时刻。

这一思路也揭示了推测解码优化中的一个现实取舍:减少目标模型调用,通常意味着增加草稿模型计算。只有当草稿模型足够轻量、额外起草成本低于节省的目标模型成本时,整体墙钟时间才会改善。因此,置信度策略、草稿模型规模、硬件并行效率以及目标模型与草稿模型之间的协同,都会影响最终收益。

对于大模型推理服务,DLoop 提供了一条与继续压缩模型或升级硬件不同的优化路径。它尤其适合目标模型验证成本高、而草稿模型具有较高接受率的场景。后续实际部署仍需要在不同批大小、序列长度和硬件环境下评估收益,但其核心启发很明确:推测解码不一定要在每次起草后立即停下来验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
RouteFM:让大模型路由从反复训练走向“一次预训练,随处路由”
推理与部署
cctest.ai
推理与部署

RouteFM:让大模型路由从反复训练走向“一次预训练,随处路由”

RouteFM提出将LLM路由视为一种可迁移的基础能力:路由器不再依赖固定模型名称,而是通过少量行为观测判断匿名模型的特长。实验显示,冻结后的路由器能够跨任务、模型池、模态和上下文预算迁移。

阅读全文