返回文章列表
推理与部署

让草稿模型学会“预判验证”:VAT提升推测解码效率

阅读约 3 分钟

导语

推测解码是当前大语言模型推理优化的重要路线:一个较小的草稿模型先快速生成一串候选 token,再由目标模型通过一次前向计算进行批量验证。只要候选序列足够长且大多正确,就能减少目标模型逐 token 解码的次数。不过,这套机制有一个关键特点:验证是顺序进行的,一旦某个位置首次被拒绝,从该位置开始的后续候选通常都会失效。

NAVER AI Lab在论文《Verification-Aware Training for Speculative Decoding》中提出Verification-Aware Training(VAT),尝试让草稿模型在训练阶段就面对这一现实约束。它不是重新设计草稿模型或目标模型,而是修改训练目标,因此可以作为插件叠加到已有方法上。

核心要点

  • 用验证结果提供监督。 VAT在每个训练步骤中模拟目标模型对候选序列的顺序验证,并记录每个位置是否能够“存活”。在此基础上,研究团队加入一个轻量级验证头,将每个位置能否通过验证作为二分类学习目标。草稿模型由此不只学习目标模型的 token 分布,还学习哪些位置更可能继续保留。
  • 让损失权重匹配真实收益。 传统草稿训练通常使用固定的逐位置权重,但这种安排没有体现首个拒绝点的影响。VAT提出验证自适应加权:在样本首次被拒绝之前保持完整权重,并以首个拒绝位置为新的锚点重新开始衰减。这样,训练重点会更贴近实际验证中真正有机会贡献有效长度的区域。
  • 保持推理侧不变。 VAT不要求更换目标模型、草稿模型架构或推测解码算法,主要改变训练目标和相关监督信号,因而具备较强的兼容性。

实验结果与意义

论文将VAT应用于EAGLE-3和DFlash,并在Qwen3-4B、Qwen3-8B以及LLaMA-3.1-8B上进行评估。结果显示,平均接受长度最高提升11.4%,实际墙钟加速最高提升8.7%;在数学、代码和聊天任务上也观察到一致收益。素材未提供完整实验设置、基线细节或不同配置下的逐项结果,因此这些数字更适合被理解为论文报告的上限表现,而不是所有场景都能复现的固定增益。

VAT的价值在于指出了草稿模型训练中的一个常被忽视的问题:token级模仿准确率并不等同于推测解码效率。对于顺序验证系统,模型不仅要尽量预测正确,还要尽可能延长连续通过验证的前缀。将推理阶段的接受与拒绝模式反馈到训练目标,或许能成为进一步优化草稿模型的通用思路。后续仍需结合公开代码和更广泛的硬件、批量大小及任务测试,判断其在不同部署环境中的实际收益。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章