TBSM:用“三体散射”训练一步生成模型
导语
生成模型的主流路线长期围绕几类范式展开:GAN依赖判别器提供对抗信号,扩散模型沿着预设的加噪—去噪路径学习,很多高质量少步模型又需要教师模型蒸馏。论文《Three-Body Scattering for Generative Modeling》提出的TBSM试图换一个角度:不先规定从噪声到数据的轨迹,也不训练一个对抗批评器,而是直接学习“生成样本该往哪里移动”。
核心思路
TBSM的全称是Three-Body Scattering Modeling,可理解为一种“三体散射”式的生成训练框架。它把生成分布与真实数据分布之间的差异写成一种分布能量,并利用这种能量诱导样本级的运动场。对每个被称为projectile的生成样本,训练事件只需要两个参照:一个真实来源样本负责“吸引”,另一个独立生成来源样本负责“排斥”。
这种设计的关键在于,把原本可能涉及小批量内大量两两交互的场估计,压缩为每个样本常数规模的交互。论文称,在给定projectile及其条件时,该散射方向的期望等价于相应能量距离平方的一半在2-Wasserstein梯度流下的速度。因此,模型不是间接等待判别器评分,也不是沿着固定噪声日程学习,而是获得一个可回归的“移动方向”。
方法要点
- 一步生成监督:TBSM为生成器提供直接的回归目标,面向一步或少步生成,而不是依赖多轮采样过程。
- 三体事件构造:每个训练事件包含一个待移动样本、一个真实参照和一个独立生成参照,形成吸引与排斥的组合。
- 降低交互成本:一批B个冻结目标事件可产生O(B)个样本级损失,相比需要小批量全配对场的Drifting类方法更简洁。
- 在线跟踪期望:论文强调,通过在线跟踪条件期望,可以减少场估计噪声,使训练更稳定。
- 特征空间散射:实验中使用冻结图像特征中的散射信号来训练高维图像生成器。
实验结果与定位
在ImageNet-256任务上,论文报告TBSM训练的一步生成器在NFE=1下取得较强结果:像素空间PixelDiT-XL达到FID 2.23,潜空间DiT-XL达到FID 1.63。素材还提到,该方法展示了在最高20B参数规模文本到图像模型上的稳定训练,并支持一步与少步生成,且不需要额外辅助损失。
这些数字的意义不只在于“更快采样”。一步生成一直是高质量图像生成的难点:采样步数越少,模型越难同时保持细节、语义一致性和分布覆盖。TBSM的价值在于提供了一种不依赖预设去噪路径的训练信号,尝试把“如何把生成分布推向真实分布”变成可直接学习的传输问题。
意义与影响
TBSM还试图给不同生成范式画出一张统一地图:扩散监督、Drift式动力学和GAN式目标,都可以从分布传输场的角度重新理解。若这一框架在更多数据集、模型规模和条件生成场景中得到验证,它可能成为少步、一步生成模型的重要训练路线。
当然,当前信息主要来自论文摘要和项目页,仍需关注完整论文中的训练成本、稳定性边界、与强基线的公平比较以及开源代码可复现程度。但就方向而言,TBSM为高效生成模型提供了一个值得关注的新视角:与其模拟一条漫长采样轨迹,不如直接学习样本应该被“推”向哪里。
评论
正在确认登录状态……
正在加载评论……