DiffusionGemma:用离散扩散打破大模型逐词生成瓶颈
导语
大语言模型的生成速度长期受制于自回归机制:模型通常必须先生成第一个 token,再生成第二个 token,逐步向后推进。即使有 speculative decoding 等推理优化,底层流程仍然带有明显的串行特征。DiffusionGemma 技术报告提出了另一条路线:把文本生成问题改造成离散扩散过程,让模型在一个 token 块内并行迭代修正答案。
这项工作来自 DeepMind 团队,模型为开放权重实验模型。它并非从零训练,而是在 Gemma 4 混合专家模型基础上进行微调;起始模型为 3.8B 激活参数、25.2B 总参数规模。报告强调,整个扩散化训练流程使用的 token 预算少于起始自回归模型总训练 token 预算的 10%。
核心要点
- 从逐词生成转向块级细化:DiffusionGemma 不按传统方式一个 token 一个 token 地解码,而是对 256 个 token 的文本块进行并行迭代细化。这使它有机会绕开自回归模型最典型的顺序解码瓶颈。
- 采用离散扩散生成文本:扩散模型在图像领域已被广泛使用,但文本是离散符号序列,处理难度不同。DiffusionGemma 的思路是通过双向去噪学习,让模型在被扰动的文本块中逐步恢复更合理的输出。
- 两阶段训练更重视计算效率:第一阶段使用监督微调,让模型学会双向去噪;第二阶段结合强化学习与采样器蒸馏,同时优化生成质量和推理效率。
- 速度指标突出:报告称,在完整评测套件平均结果上,模型每次前向传播大约生成 20 个 token,在单张 NVIDIA H100 GPU 上达到约 1,500 个输出 token/秒,相比采用先进 speculative decoding 的自回归模型也更快。
- 能力保留较多:虽然模型经过扩散微调,报告称它仍保留起始模型对思考模式、多模态输入和长上下文的支持,并且依然可以进行自回归生成,性能仅有小幅下降。
意义与影响
DiffusionGemma 的价值在于,它把“文本扩散模型是否能成为实用 LLM 路线”这个问题推进了一步。过去,扩散模型在文本生成中常被认为难以兼顾质量、速度和通用能力;而这份报告试图证明,通过在强自回归底座上进行计算高效的扩散微调,可以得到新的速度—能力折中点。
对推理服务而言,如果块级并行生成能够稳定适用于更多任务,它可能显著改善高吞吐场景,例如批量内容生成、低延迟助手、长文本草拟等。更重要的是,DiffusionGemma 没有完全放弃自回归能力,这暗示未来可能出现扩散与自回归混合解码:在需要速度时使用扩散并行生成,在需要更强局部控制或兼容性时回到 AR 模式。
当然,报告摘要并未给出所有任务细节、失败案例或部署成本。DiffusionGemma 目前仍应被理解为实验性探索,而不是对现有 LLM 架构的彻底替代。但它清楚传递了一个信号:下一阶段的模型竞争,除了参数规模和训练数据,解码范式本身也可能成为关键创新点。
评论
正在确认登录状态……
正在加载评论……