DLoop:让推测解码少做几次大模型验证
导语
自回归大语言模型生成文本时,真正昂贵的往往不是输出一个 token,而是不断调用规模更大的目标模型。推测解码的思路是先让轻量草稿模型提出一段候选 token,再由目标模型批量验证,以较少的目标模型调用换取更高吞吐。但现有流程通常在每个草稿阶段之后立即验证,即使这一阶段产生的 token 全部正确,也不能直接继续起草。
NAVER AI Lab 的论文 DLoop: Looped Speculative Decoding 针对这一问题,将推测解码改造成一种“循环式”流程:只要草稿模型仍然具有足够信心,就继续进行下一轮草稿生成,最后把多轮累积的 token 一起交给目标模型验证。
核心要点
- 把多轮草稿合并验证。 传统方法大致是“起草一轮、验证一轮”。DLoop 则允许在一次目标模型验证前执行多个起草阶段,从而减少昂贵的目标模型前向计算。
- 由置信度决定是否继续。 当草稿模型对当前候选仍有信心时,系统延迟验证;一旦信心下降,再集中验证已经积累的 token。这让验证频率能够随生成状态动态变化。
- 兼容不同类型的草稿模型。 对自回归草稿模型而言,延长草稿长度相对直接;对并行草稿模型而言,未验证 token 缺少目标模型提供的隐藏状态,继续起草更困难。DLoop 将这一限制纳入训练和推理流程。
- 引入 loop-aware training。 训练时让草稿模型接触由自身生成、但尚未经过目标模型确认的 token 隐藏状态,帮助它适应额外的循环阶段,避免连续起草后可靠性明显下降。
- 保持无损解码。 论文报告称,DLoop 在 EAGLE-3、DFlash、Domino、DSpark 以及多 token 预测模块等方法上均可提升墙钟速度,提升幅度为 5% 至 41%,同时保持无损解码。
意义与影响
DLoop 的价值不在于单纯扩大草稿模型,而在于重新安排“起草”和“验证”的节奏。随着草稿模型能力增强,目标模型越来越可能接受一整轮候选 token。如果仍然固定每轮验证,就会把大量计算花在重复确认上。DLoop 的策略是把这些高概率正确的阶段串联起来,把目标模型调用集中到更有必要的时刻。
这一思路也揭示了推测解码优化中的一个现实取舍:减少目标模型调用,通常意味着增加草稿模型计算。只有当草稿模型足够轻量、额外起草成本低于节省的目标模型成本时,整体墙钟时间才会改善。因此,置信度策略、草稿模型规模、硬件并行效率以及目标模型与草稿模型之间的协同,都会影响最终收益。
对于大模型推理服务,DLoop 提供了一条与继续压缩模型或升级硬件不同的优化路径。它尤其适合目标模型验证成本高、而草稿模型具有较高接受率的场景。后续实际部署仍需要在不同批大小、序列长度和硬件环境下评估收益,但其核心启发很明确:推测解码不一定要在每次起草后立即停下来验证。
评论
正在确认登录状态……
正在加载评论……