返回文章列表
推理与部署

SlimWise:只在解码阶段剪枝,降低 MoE 推理流量

阅读约 2 分钟

导语

混合专家模型(MoE)通过让每个 token 只调用部分专家,降低了单 token 的计算量。但在真实的批量解码服务中,多个请求的路由选择会分散到更大的专家范围,专家权重频繁搬运反而可能成为主要瓶颈。如何减少这类内存与通信开销,同时不明显损害模型能力,成为 MoE 部署的重要问题。

SlimWise 的核心思路不是对整个推理过程一刀切地剪枝,而是区分 prefill(预填充)和 decode(解码)两个阶段:前者使用完整专家池,后者才使用剪枝后的模型。

核心方法

  • 预填充保留完整模型:输入上下文通常在预填充阶段集中处理,计算更偏密集型。SlimWise 不在这一阶段削减专家,以避免为有限的吞吐收益牺牲模型质量。
  • 解码阶段缩小专家池:生成过程逐 token 进行,专家权重访问和搬运更加突出。系统在此阶段移除部分专家,减少潜在的权重流量。
  • 直接复用 KV cache:剪枝解码器继续使用完整模型在预填充阶段生成的 KV cache,无需额外格式转换。这种训练免费的缓存交接,是其减少精度损失的关键之一。
  • 可选轻量蒸馏:针对剩余的质量下降,以及基准准确率无法反映生成长度变化的问题,SlimWise 训练解码器学习从完整模型 KV cache 继续生成,同时只更新少量参数。

该框架已集成到 vLLM,支持预填充—解码分离(PD disaggregation)和两阶段共置部署。论文在两种 MoE 骨干和三类剪枝标准上进行了评估,并特别提醒:仅观察任务准确率,可能低估剪枝对输出长度和实际服务成本的影响。

意义与影响

SlimWise 体现了一种面向服务阶段的模型压缩思路:不同阶段的瓶颈并不相同,压缩策略也不应完全一致。保留预填充质量、集中优化解码流量,能够更贴近在线生成服务的实际成本结构。素材显示,在 Qwen3.6-35B-A3B 上,剪枝 50% 专家时,解码吞吐最高提升 1.81 倍,同时保持较小的准确率损失。

不过,这一方案并不意味着剪枝可以无条件扩大。实际收益仍会受到批大小、请求长度、专家路由分布以及部署方式影响;而蒸馏阶段也引入了额外训练和参数维护成本。因此,SlimWise 更适合作为完整模型与激进压缩之间的折中方案:用完整模型承担对质量更敏感的上下文处理,再让轻量化解码器负责高频生成。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
RouteFM:让大模型路由从反复训练走向“一次预训练,随处路由”
推理与部署
cctest.ai
推理与部署

RouteFM:让大模型路由从反复训练走向“一次预训练,随处路由”

RouteFM提出将LLM路由视为一种可迁移的基础能力:路由器不再依赖固定模型名称,而是通过少量行为观测判断匿名模型的特长。实验显示,冻结后的路由器能够跨任务、模型池、模态和上下文预算迁移。

阅读全文