RAZOR:用“可替代性”判断 MoE 专家是否值得保留
导语
混合专家模型(MoE)通过每个 token 只激活少数专家,降低了单次计算量,但模型仍需保存完整的专家池。随着模型规模扩大,如何在尽量不损失能力的前提下删除部分专家,成为降低存储与部署成本的重要问题。arXiv 论文提出的 RAZOR,将剪枝重点从“专家有多常用”转向“其他专家能否替代它”。
核心方法:衡量功能可替代性
传统剪枝指标往往关注专家的使用次数、路由权重或输出幅度。然而,一个被频繁调用的专家未必不可替代;相反,一个使用较少的专家也可能承担其他专家无法覆盖的功能。RAZOR 的基本思路,是观察单个专家输出与原始加权专家混合结果之间的差异,将这种差异称为“共识残差”。
在固定层输入下,论文推导了删除单个专家后的精确变化关系。该关系同时考虑两类容易被忽略的影响:保留专家权重重新归一化,以及路由器在专家被删除后选择替代专家进行补位。RAZOR 使用校准数据收集这些局部信号,再将其汇总为面向给定剪枝预算的排序分数。整个流程不需要梯度,也不要求剪枝后进行恢复训练,因此适合用作相对轻量的模型压缩步骤。
实验结果
论文在 GLM-4.7-Flash、Qwen3.6-35B-A3B、DeepSeek-V4-Flash-0731 和 Hy3 上测试了 25% 与 50% 两种专家移除比例。在八个模型—预算组合中,RAZOR 都取得了参与比较方法中的最高九任务宏平均分。
与具有匹配测试结果的 REAP 相比,RAZOR 在两个模型上提升了 2.12 至 5.59 个百分点,并在 36 个成对任务比较中全部胜出。在 GLM-4.7-Flash 和 Qwen3.6-35B-A3B 的四个匹配模型—预算设置中,RAZOR 的反向 KL 也均低于 REAP,说明剪枝后的预测分布在这些实验中更接近原模型。
意义与局限
RAZOR 的价值在于提供了一个更贴近 MoE 工作机制的剪枝视角:删除风险不由专家的重要性单独决定,而取决于剩余专家的功能覆盖能力。由于不需要重新训练,它可能适合资源受限的部署场景,或作为大规模专家池压缩前的快速筛选工具。
不过,论文的结论也提示,任务保留率和预测分布相似度并不能覆盖所有生成质量。对 Qwen3.6-35B-A3B 输出的分析发现,剪枝后仍可能出现多样性、格式和终止行为变化。因此,未来评估不能只看基准分数或 KL 指标,还应加入长文本生成、结构化输出和停止行为等稳定性测试。RAZOR 更像是降低剪枝损伤的有效方法,而不是保证压缩模型与原模型完全一致的方案。
来源:arXiv
评论
正在确认登录状态……
正在加载评论……