返回文章列表
扩散模型

扩散语言模型里,真的藏着一只“潜意识时钟”

阅读约 3 分钟

导语

扩散语言模型(Diffusion Language Models,DLMs)近来被视为自回归语言模型之外的一条重要路线。与逐 token 从左到右生成不同,扩散式方法通常从带噪声的序列开始,经过多轮去噪逐渐形成文本。问题在于:许多 DLM 并不像标准扩散模型那样显式接收“当前时间步”作为条件。那么,它们如何知道自己处在去噪过程的哪个阶段?

论文《Subliminal Clocks: Latent Time Modelling in Diffusion Language Models》给出了一个有意思的答案:模型内部可能存在一只“潜意识时钟”。也就是说,即使没有外部时间步输入,DLM 的激活空间中仍然编码了与去噪进度相关的潜在表征。

核心要点

  • DLM 内部可解码出时间信号:作者关注模型残差流中的表示,发现通过探针可以较可靠地从不同层激活中提取与扩散时间步相关的信息。这说明去噪进度并非完全隐形,而是以某种形式存在于模型内部状态中。

  • 这种信号不只是旁观变量:研究进一步表明,沿着与推断时间步相关的低维子空间对模型进行“steering”,可以系统性地改变模型对去噪进度的感知。相应地,模型输出的置信度和熵也会出现可预测变化。

  • 表征具有结构化几何特征:论文还分析了这一时间表征在激活空间中的几何形态,认为它并不是随机噪声,而是呈现出一定的结构性和可解释性。这有助于理解 DLM 如何在没有显式时间条件的情况下组织去噪过程。

意义与影响

这项工作的重要性不在于提出一个新的生成模型,而在于打开了 DLM 内部机制的一扇窗。过去,人们更多从性能、采样速度或生成质量角度讨论扩散语言模型;而这篇论文把焦点放在模型“如何知道自己生成到哪一步”这一机制问题上。

如果 DLM 的内部确实存在可操控的时间表征,那么未来可能出现更精细的推理与生成控制方式。例如,研究者可以尝试调节模型在早期更探索、后期更确定的行为,也可以分析不同层在去噪过程中的分工。不过,素材并未声称这已经直接带来更强性能或可部署系统,因此更稳妥的理解是:它为 DLM 可解释性和可控生成研究提供了一个新的切入点。

从更大范围看,这也提示我们,神经网络可能会在缺少显式变量输入时,自发构造完成任务所需的内部坐标系。对语言扩散模型而言,那只“看不见的钟”或许正是它们管理去噪进程的关键线索。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章