ALoDLM:让扩散语言模型按 token 难度分配计算
扩散语言模型(DLM)与自回归模型的主要区别,在于它可以同时预测多个位置的 token,而不是严格按照从左到右的顺序生成。这种并行特性有望降低生成延迟,但质量表现长期落后于参数规模相近的自回归模型。论文《ALoDLM: Adaptively Looped Diffusion Language Models》将问题归因于一个关键的计算分配不匹配:同一条部分可见的序列中,有些未知 token 很容易确定,有些 token 却需要更多推理。
从统一计算转向按 token 循环
现有扩散语言模型通常在每次去噪步骤中,对所有未知位置执行相同深度的计算。这种做法简单,却没有区分 token 难度:容易预测的位置可能被重复计算,而困难位置又可能过早做出决定。ALoDLM 的核心思路是引入 token 自适应的潜在循环,让不同位置拥有不同的计算轨迹。
在每个去噪步骤中,模型会反复更新 token 的潜在表示。对于已经足够确定的位置,模型将其转换为离散 token,并反馈为后续预测可见的上下文;对于尚未解决的位置,则保留潜在状态,继续进行额外循环。由此,模型不再要求整条序列同步完成同样次数的计算,而是把更多计算留给仍然困难的 token。
联合学习预测与计算调度
这一机制还带来一个训练问题:模型不仅要预测 token,还要学习何时停止某个位置的继续计算。为此,论文把 token 级计算计划视为潜变量,并推导条件负证据下界(NELBO),以联合学习 token 预测和计算分配。换言之,计算深度不再只是人工设定的推理超参数,而成为模型训练过程中需要学习的部分。
作者在 1.7B 和 8B 两种参数规模上训练 ALoDLM,并在 11 项基准上进行评估。论文报告称,在两个规模上,ALoDLM 的平均基准成绩都超过了被比较的扩散语言模型及相应的自回归基线。与此同时,模型仍保留扩散模型的并行解码特性;在使用优化后的推理引擎时,它在被评估的自回归模型和扩散模型之间展现出较强的质量—效率权衡。
意义与局限
ALoDLM 的价值不只是增加循环次数,而是改变了扩散语言模型的计算组织方式:从“所有位置统一处理”转向“根据不确定性动态处理”。这为扩散模型缩小与自回归模型之间的质量差距提供了一条直接路径,也说明并行生成与差异化计算并不矛盾。
不过,现有材料主要给出了方法概述和总体结论,未提供各基准的具体分数、延迟数据或不同调度策略的消融结果。因此,ALoDLM 在不同任务、序列长度和硬件环境下的收益,还需要结合完整论文与更细致的实验数据判断。若其自适应调度能够稳定工作,扩散语言模型或许能在保持并行性的同时,更有效地把计算预算集中到真正困难的位置。
评论
正在确认登录状态……
正在加载评论……