Explorative Modeling:为生成模型引入“探索”这一新缩放轴
导语
生成模型已经在图像、视频和语言任务中展现出强大能力,但它们往往并不是严格意义上的端到端生成系统。扩散模型、流模型或自回归模型通常会把生成过程拆成多个步骤:逐步去噪、逐步变换,或逐 token 预测。论文《Explorative Modeling》试图回答一个更基础的问题:如果深度学习的成功来自端到端训练,生成建模是否也能摆脱对分阶段生成流程的依赖?
作者提出的 Explorative Modeling(XM)并不是简单增加模型规模或数据规模,而是把“探索”引入训练环节:模型不只尝试一个生成结果与数据样本的对应关系,而是探索 K 个候选匹配,再选择其中最优者进行训练。这样做的目标,是让预测更坚定地选择某个模式,而不是在多峰分布中把多个可能答案平均成模糊结果。
核心要点
- 把分解从生成过程移到训练过程:传统可扩展生成方法常把生成拆成许多步骤,XM 则在训练循环中探索多个候选匹配,保留更端到端的生成可能性。
- “探索”成为第三条预训练轴:除参数量和数据量外,作者认为探索数量也可被缩放。论文称,在图像、视频和语言等连续与离散领域,增加探索会带来单调性能提升。
- 规模越大,探索收益越明显:素材中给出的结果显示,随着数据规模扩大,探索带来的收益从 7% 提升到 36%;随着模型增大,收益从 13% 提升到 23%。
- 效率指标有明显改善:论文报告 XM 可达到 6.2 倍样本效率、4.1 倍 FLOP 效率,并带来 47% 的参数效率提升;在 3 倍计算量下,效率收益超过翻倍。
- 可能推动端到端生成:作为端到端生成模型,XM 在控制任务上可匹配扩散模型,并报告最高可减少 256 倍推理计算。
意义与影响
这项工作的关键价值在于,它把生成模型的缩放问题从“更大模型、更大数据”扩展到“更充分的训练时探索”。如果结论能在更多设置中复现,探索规模可能成为生成模型训练配方中的重要旋钮,类似 batch size、数据质量和模型宽深度那样影响最终表现。
更值得关注的是端到端生成方向。当前扩散模型的优势来自稳定、可控和高质量,但代价是多步推理;自回归模型适合离散序列,却也天然依赖逐步生成。XM 试图通过训练时的多候选选择,让模型在推理时少走步骤,同时仍能处理多模态目标分布。这对低延迟生成、交互式控制和资源受限部署都具有潜在吸引力。
当然,素材主要来自论文摘要与 TLDR,仍需要完整论文和独立复现实验来判断其适用边界,例如探索 K 的计算成本、不同任务上的稳定性,以及与现有扩散或自回归训练技巧的兼容性。但从研究思路看,Explorative Modeling 提供了一个有启发性的视角:生成模型的下一轮效率提升,未必只来自更大的网络,也可能来自更聪明的训练时搜索。
评论
正在确认登录状态……
正在加载评论……