Edge0:用训练式预路由让35B MoE跑在SSD上
导语
让大型混合专家模型(MoE)运行在普通消费级设备上,难点往往不只是算力,而是权重如何被及时送到计算单元。MoE每个 token 只激活少数专家,理论上能减少计算量;但模型的全部专家权重仍然需要存储。以35B级模型为例,4-bit权重约占19.5GB,已经接近甚至超过不少消费级设备的可用内存。
Edge0的思路是把部分专家权重放到SSD,并通过“预路由”提前发起读取。项目材料称,它可以在单台24GB机器上运行35B级MoE,峰值活动内存控制在3GiB以内,生成速度达到20 token/s;同时,输出质量在五个公开基准上平均只比FP16教师模型低几个百分点。
核心方法
- 问题在于路由存在时序依赖。 第N+1层需要哪些专家,通常要等第N层输出完成后才能计算。若等路由结果产生后再从SSD读取,I/O很难被前一层计算隐藏,SSD卸载就可能变成新的延迟瓶颈。
- 预路由器提前猜下一层。 Edge0为每层加入一个轻量预测头,根据当前状态预测下一层的专家选择,使SSD读取能够更早开始。
- 预测结果直接替代路由结果。 这并不是先预测、再与真实路由比较后修正,而是将预测结果直接作为实际路由。因此,项目讨论中的“100%准确”更准确地说是执行路径内部的一致性:系统必然执行自己预测的专家,并不等同于预测传统路由器的准确率达到100%。
- 用恢复LoRA补偿质量损失。 量化和路由替换都可能损害模型表现。Edge0训练一个不与主模型权重合并的恢复LoRA,且训练过程采用学生路径,目标是让适配器适应实际部署时的量化与预路由行为。
意义与待观察问题
如果这一方案的测量结果能够复现,它展示了一条不同于单纯压缩模型的边缘推理路线:通过改变专家访问的时间安排,把存储带宽纳入模型服务架构设计。对于内存有限但拥有较快NVMe SSD的设备,模型规模与可运行性之间的边界可能因此移动。
不过,预路由的核心代价也需要透明呈现。素材没有给出逐层预测质量、长尾错误、错误预测是否引发额外读取,以及不同SSD和序列长度下的延迟分布。由于预测结果会直接决定执行专家,错误不会以“回退到正确专家”的方式被自动消除,而可能体现为输出质量下降。因而,平均基准分数和平均吞吐量之外,逐层路由差异、首 token 延迟、每 token 延迟抖动、SSD带宽占用和长文本稳定性,都是判断Edge0能否实用的关键指标。
总体来看,Edge0的价值不只在于把35B MoE装进更小的活动内存,而在于将路由预测、权重预取、量化恢复和流式执行结合起来。它的开放框架、检查点和适配器也为后续复现提供了基础,但最终结论仍应以完整论文、代码和更细致的系统评测为准。
评论
正在确认登录状态……
正在加载评论……