返回文章列表
扩散模型

文本条件也有缩放规律?这篇论文重新审视视觉生成提示词

阅读约 2 分钟

导语

在文本到图像生成中,大家通常会讨论模型规模、数据规模和采样策略,却较少系统衡量“提示词本身”如何随规模变化影响模型训练。论文 Scaling Properties of Text Conditioning in Visual Generation 把问题推进了一步:扩散模型的损失并不会简单随自然语言提示的 token 数增长而变化,但如果提示中包含更多结构化信息,收敛后的扩散损失会出现可观测的规律性变化。

核心要点

  • 研究对象不是提示词越长越好,而是结构化程度。 作者指出,自然语言 prompt 的长度并不能直接解释扩散训练损失的变化。真正值得度量的是其中是否包含清晰、可学习的语义、属性和空间关系。
  • 提出两类互补度量。 论文采用白盒似然指标 GPG 与黑盒属性指标 ED 来量化结构化语言。前者更接近模型内部的概率视角,后者则从外部属性匹配角度评估提示信息量。
  • 观察到经验缩放规律。 在受控训练实验中,收敛后的扩散损失会随 GPG 近似线性下降,并与 ED 呈现幂律关系。这意味着文本条件的“质量”可能像数据或模型规模一样,具有可被建模的缩放行为。
  • 从规律走向系统改进。 作者将图像中的语义与几何信息转化为结构化提示,以提升所谓 diffusability;同时通过监督微调、冷启动以及 verifier-gated on-policy distillation 训练 prompter,提高 promptability。

意义与影响

这项工作的价值在于,它把 prompt 从“经验工程”推向了更可测量的训练变量。过去,提升文生图模型往往依赖更大模型、更好数据或更复杂后处理;而这篇论文强调,训练时给模型看的文本条件也可以被系统优化。若结构化语言确实能稳定降低扩散损失,那么数据标注、自动 caption、图像理解模块和提示生成器都会成为提升视觉生成能力的重要环节。

同时,论文声称其系统在多种组合、推理和世界知识评测中超过所评估的开源权重模型,并在多数评测上达到或超过强闭源模型水平。需要注意的是,素材未提供完整实验表格与具体数值,因此这些结果仍应结合论文原文进一步审视。但从方向上看,文本条件缩放规律为扩散模型训练提供了一个新的优化轴:不仅要让模型更大,也要让语言条件更“可扩散”、更“可提示”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章