Dust:不用反向传播,也能预训练 Transformer?
导语
反向传播几乎定义了现代深度学习的训练方式:它利用可微结构计算梯度,再由优化器更新参数。但如果未来计算资源足够充裕,是否可以少依赖可微性,转而用更通用的搜索方法训练神经网络?研究团队提出的 Dust,正是在探索这一问题。
Dust 做了什么
Dust 属于零阶优化方法,不通过解析求导获得梯度,而是对网络中的激活施加扰动,观察损失如何变化,再把“带来更低损失”的扰动加权汇总,形成更新方向。
它与传统进化策略的关键区别,在于搜索对象不是权重,而是激活,并且扰动独立发生在每个 token 上。这样,每个 token 都可以被视为一个“虚拟种群成员”,同一次前向计算便能并行评估大量候选,而不必真正复制和存储大量模型实例。研究还针对 Transformer 不同类型的层设计了不同的 token 级奖励规则,并尽量减少被扰动模块之间的相互干扰。
核心要点
- 在语言模型预训练测试中,Dust 被报告为首批能够接近反向传播表现的零阶方法之一。
- 当虚拟种群规模扩大时,Dust 的梯度估计与反向传播更一致;在若干设置中,表现甚至超过反向传播。
- 相比直接在权重空间运行进化策略,激活空间搜索显著降低了评估和存储开销。论文估算,在一定 token 规模以上,Dust 相比其对照的 Transformer 版 EGGROLL 可高效多个数量级。
- 一个反直觉结果是,大模型在许多种群规模下反而更高效地利用搜索,研究中的较大模型表现优于小得多的模型。
- 这些结果并不意味着 Dust 已经能以更低成本取代反向传播。作者明确表示,该方法当前仍不具备现实部署所需的计算效率。
意义与局限
Dust 的价值首先是方法论上的:它说明零阶优化并非只能用于小模型或简单任务,经过激活空间和并行计算设计,也能触及 Transformer 预训练这一高难度场景。激活空间还可能提供一种搜索内部表征和潜在推理过程的路径,为外部程序、非标准模块或不可微组件参与训练留下空间。
不过,接近反向传播通常需要更大的种群和更多计算,这也是 Dust 当前最明显的代价。现有结论主要证明了可行性和扩展趋势,尚不足以说明它在实际训练成本、数据效率或最终能力上全面优于反向传播。更现实的下一步,是观察该方法能否在更大规模、更多架构以及包含不可微组件的系统中保持优势。
来源:Hacker News
评论
正在确认登录状态……
正在加载评论……