返回文章列表
推理与部署

Uno:用离散扩散为大语言模型实现无损加速

阅读约 3 分钟

导语

自回归语言模型的优势在于稳定、成熟且容易扩展,但它也有一个天然瓶颈:每次只能预测下一个Token。即使GPU拥有充足的并行计算能力,生成过程仍会被串行依赖限制。来自这篇论文的Uno,试图用离散扩散式的并行草拟机制,缓解这一问题,同时保留原有自回归模型的输出质量。

核心方法

Uno的设计重点不是重新训练一个纯扩散语言模型,而是在自回归模型之上增加一组轻量的扩散参数。整体思路可以概括为:

  • 保留AR主干:基础模型继续使用标准的下一Token预测目标进行训练,承担最终的分布定义和结果验证。
  • 增加扩散路径:扩散权重通过一个额外的Diffusion Distillation阶段学习,在一次计算中草拟多个Token。
  • 并行生成、串行校验:扩散路径先提出候选序列,再由自回归权重验证。只要候选符合原AR模型的采样分布,就能在不牺牲模型质量的情况下推进多个位置。
  • 无需独立草稿模型:与推测解码不同,Uno不需要额外部署一个小型语言模型作为drafter,因此可以减少模型维护和显存管理负担。

论文还提出Ψ-Spec采样器,用于在固定上下文长度下进行无损加速和推理时扩展。作者称,Uno在不同批量大小下的吞吐都超过了所比较的推测解码方法,最高可达到基础AR模型约3倍的加速;论文摘要还指出,8B Uno在相关比较中超过了更大规模的开源扩散语言模型DiffusionGemma。不过,原始摘要在末尾被截断,完整对比范围仍应以论文正文和实验表格为准。

如何理解“无损”

这里的“无损”并不是说扩散草拟阶段本身一定准确,而是指最终结果仍由原始自回归分布约束和验证。扩散模块的作用更接近一个并行候选生成器:它负责尽量一次提出更多可接受的Token,AR路径则负责决定哪些候选能够被保留。因此,速度收益取决于候选接受率、验证开销、批量大小以及硬件并行效率,而不是简单地把串行步骤全部删除。

争议与影响

这项工作也引发了关于技术原创性边界的讨论。Hugging Face页面评论指出,较早的Orthrus同样采用了冻结AR骨干、增加可训练扩散路径、复用KV缓存、并行草拟并由AR验证的总体框架。Uno作者则强调,两者在架构实现上存在差异:Uno倾向于保持原有注意力架构,并使用LoRA等方式扩展扩散能力;Orthrus则引入额外扩散注意力头,并在扩散路径中采用双向注意力。双方的分歧因此集中在“核心框架是否相同”,而不只是具体模块设计。

无论最终如何界定优先权,Uno所代表的方向具有现实意义:它没有把自回归模型和扩散模型视为二选一,而是尝试让AR模型继续负责质量保障,让扩散机制承担并行化任务。若后续实验能在更多模型、序列长度和服务负载下稳定复现收益,这类混合架构可能成为推理加速的一条重要路线。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章