HC-DLM:让连续扩散语言模型在并行生成中保留词元依赖
导语
扩散语言模型一直在探索自回归生成之外的另一条路线。与按照固定顺序逐词生成不同,扩散模型可以从整体状态出发,逐步还原一段文本,因此天然适合需要双向信息和全局约束的任务。不过,如何在并行生成的效率与词元之间的统计依赖之间取得平衡,仍是这一方向的关键问题。
来自伊利诺伊大学香槟分校团队的论文提出了 Hierarchical Continuous Diffusion Language Models(HC-DLM)。它的核心思路,是把离散词元和连续潜变量放进同一个逐步去噪过程,而不是让两条生成链彼此独立。
核心要点
- 离散扩散的瓶颈:并行解码时,模型可能分别依据每个位置的边缘分布采样词元。这样虽然提高了并行度,却可能削弱同时生成的词元之间的依赖关系。在数独或数学规划等任务中,这类依赖往往直接关系到最终答案是否满足全局约束。
- 连续扩散的局限:连续扩散模型通过共同去噪一个连续状态来保存整体信息,但在最终解码前,这个状态与合法的离散词元配置之间缺少持续、明确的联系。
- 潜变量成为唯一状态:HC-DLM 不把连续表示仅仅当作附加上下文,而是让连续潜变量承担整个生成过程的状态记忆。每一步都从潜变量读出离散词元,再把这些词元作为下一次潜变量更新的支架。
- 统一的训练目标:论文从词元似然的变分下界推导训练目标,使离散生成和连续轨迹能够在同一框架中协同优化,而不是简单拼接两个已经完成的模型。
实验与意义
论文在结构化推理任务数独、数学规划任务 Countdown,以及 LM1B 语言建模数据集上进行评估。根据作者报告,在模型规模相当的条件下,HC-DLM 相比离散和连续扩散基线,在数独与 Countdown 的谜题准确率,以及 LM1B 的生成困惑度方面取得改进。素材没有提供具体提升幅度,因此这些结果更适合作为方法有效性的初步信号,而非对所有任务的普遍结论。
从方法设计看,HC-DLM 的价值不只在于引入一个连续表示,而在于重新安排了离散与连续信息的交互方式:词元不是最后才被读取的结果,而是每轮去噪都参与状态演化的中间 scaffold。若这一机制能够在更大规模语言建模和更复杂约束任务上保持稳定,它可能为扩散语言模型提供一种兼顾全局协调与离散可控性的建模路径。
当然,现有素材尚未披露更完整的消融实验、采样速度、计算成本和扩展性结果。未来评估这一方向时,还需要比较其并行效率、生成质量与推理开销之间的实际权衡。
评论
正在确认登录状态……
正在加载评论……