返回文章列表
扩散模型

DiT 里的“无用”模板词,可能在暗中维持图像语义

阅读约 3 分钟

导语

在文生图扩散模型中,我们通常会把注意力放在用户输入的 prompt:猫、红色汽车、赛博朋克城市……这些内容词似乎才是语义的来源。但这篇论文提出了一个反直觉观察:在 Diffusion Transformer(DiT)内部,真正负责在生成过程中“守住”对象身份的,未必是这些显眼的内容 token,而可能是看起来没什么用的文本模板 token。

论文围绕现代大规模文生图 DiT 的去噪计算展开,试图回答一个基础问题:文本与图像 token 被联合处理时,语义到底在模型内部如何流动、存储和被再次使用?

核心要点

  • 模板 token 并非真的无用。 研究把文本 token 区分为 prompt 内容 token 与结构性模板 token。后者在文本编码器输出阶段几乎不含具体 prompt 信息,表面上像是占位或格式结构。

  • 它们在 DiT 内部变成注意力“汇聚点”。 作者结合注意力分解与跨 token 区间、注意力头、层级的定向干预,发现这些模板 token 在 DiT 中会成为图像到文本注意力的主要 sink,并对对象身份的维持产生因果影响。

  • 语义不是直接从内容词传过去的。 更有意思的是,模板 token 获得对象身份的路径并非简单的“prompt token 传给模板 token”。论文指出,prompt 语义会先注入图像 latent,再由图像 latent 回读到模板 token 中。这意味着语义在生成网络中的承载者会发生转移。

  • 可解释性发现带来剪枝规则。 基于这一机制,作者提出一种无需训练的 DiT 剪枝方法:那些最强关注 prompt token 的注意力头反而更可裁剪。实验中,剪掉这些头可减少 20% 注意力 FLOPs,GenEval 分数只下降 1.4 点。

  • 生成计算存在阶段性分工。 论文还描绘了不同深度与注意力头的角色:有的更偏语义路由,有的更偏视觉合成;生成过程也从身份形成,逐步走向身份传播与细节 refinement。

意义与影响

这项工作的重要性不只在于发现“模板 token 有用”,更在于它挑战了我们对多模态生成模型的直觉:输入端编码语义的 token,不一定就是生成过程中持续维护语义的 token。对于文生图模型的解释、压缩和调优,这都是很有价值的线索。

如果这一结论能在更多 DiT 架构和数据设置中复现,它可能帮助研究者更精确地定位哪些注意力头负责语义一致性,哪些主要参与视觉细节合成。对工程侧而言,训练免费剪枝也提供了一条降低推理成本的路径:不必只看注意力强弱本身,而要理解注意力对象在生成机制中的真实角色。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章