索尼提出 SPA:用频谱先验缓解扩散模型采样中的曝光偏差
导语
扩散模型的图像生成质量很大程度上依赖反复去噪采样。但这种“逐步修正”的机制也带来一个老问题:模型训练时看到的是受控噪声分布,推理时却必须沿着自己生成的轨迹不断前进,一旦某一步出现偏差,后续步骤可能继续放大。这类训练—推理不一致通常被称为 exposure bias。
索尼研究团队在论文 Spectral Prior for Reducing Exposure Bias in Diffusion Models 中提出,扩散模型的这类偏差不应只从像素或整体噪声强度理解,还可以放到频率域观察:训练和推理之间存在系统性的、随频率变化的信噪比误差。基于这一发现,作者提出 Spectral Alignment(SPA),在推理时用预先学习到的频谱先验对中间预测进行校准。
核心要点
- 偏差具有频率结构:论文认为,扩散模型在采样过程中并不是均匀地“多一点噪声”或“少一点噪声”,而是在不同频段上出现不同程度的偏离。这可被解释为频率相关的 SNR 误差。
- 固定修正规则不够通用:一个关键观察是,频谱错配的方向会随模型和时间步变化。也就是说,某些阶段可能需要增强某些频段,另一些阶段则可能相反。因此,简单套用固定的高频或低频补偿规则很难泛化。
- SPA 分为离线与在线两步:离线阶段,方法从训练数据中拟合一个参数化的频谱模型,形成可供采样时参考的先验。推理阶段,SPA 使用基于 FFT 的高效梯度计算,对中间预测的功率谱进行引导式校准。
- 作为引导方法接入,开销较低:SPA 不要求重新训练主模型,而是在推理时附加一项频谱对齐引导。论文称其额外计算开销约为 3%–4%。
- 可与 CFG 互补:Classifier-Free Guidance 主要用于增强条件控制与文本对齐,而 SPA 关注频谱层面的训练—推理匹配,两者目标不同,因此可以组合使用。
意义与影响
SPA 的价值在于,它把扩散模型的 exposure bias 从一个笼统的采样误差问题,拆解为可测量、可校准的频谱错配问题。相比依赖重新训练或大规模模型改造的方案,这类推理时校准方法更容易被现有生成系统试验和集成。
论文还强调,该方法并不限于单一架构:实验覆盖了像素空间扩散模型 DDPM、ADM,潜空间扩散模型 SD2.0、SDXL,以及流匹配模型 SD3.5、FLUX。这说明频谱层面的训练—推理不一致可能是更普遍的现象,而不是某个模型族的特例。
当然,素材中并未给出完整实验细节,因此还需要结合论文正文和开源实现进一步判断其在不同任务、分辨率、采样器和提示词条件下的稳定性。但从方向看,SPA 提供了一种轻量、模型无关的改进思路:不直接改变生成模型本身,而是在采样过程中让中间结果的频谱更接近训练数据所隐含的先验。
评论
正在确认登录状态……
正在加载评论……