返回文章列表
推理与部署

把SSD当“显存”:Colibrì如何让消费级电脑运行超大MoE模型

阅读约 3 分钟

导语

运行数百亿参数模型,通常首先面对的不是计算能力,而是权重能否放进显存或内存。开源项目 Colibrì 提供了另一种思路:不再要求整套模型始终驻留在高速内存中,而是把暂时用不到的权重放到 NVMe SSD,需要时再读取。

据项目介绍,Colibrì是纯 C 实现、零引擎依赖的分层推理框架,已经支持多个模型家族。它最初用于探索 GLM-5.2 这类超大规模 MoE 模型,项目页面显示其代码库已获得数万 Star。

核心机制:只让当前需要的专家进入内存

MoE 模型虽然拥有庞大的总参数量,但每个 token 通常只会激活其中一部分专家。以素材中的 GLM-5.2 为例,总参数规模为 744B,而单个 token 的激活参数约为 40B。Colibrì据此把模型拆成两类:

  • Attention、Embedding和共享专家等高频使用的部分常驻 RAM,经过 int4 处理后约占 9.9GB;
  • 数量庞大的路由专家则主要存放在 SSD 中,由 Router 决定当前需要哪些专家;
  • 已经读取过的专家会进入 RAM 缓存,有 GPU 时还可以进一步放入 VRAM。

这套机制类似面向模型权重的即时加载。专家所在的存储层只影响读取速度,不改变 Router 的选择,也不会因为设备内存较小而主动删减专家或更换权重。

缓存和预取决定实际体验

如果每生成一个 token 都从 SSD 读取专家,推理速度会非常有限。因此,Colibrì使用 LRU 缓存保存近期访问过的专家,并根据运行过程中的调用频率调整缓存优先级。项目还利用相邻层路由存在相关性的特点,尝试提前预测下一层可能使用的专家,在当前层计算时并行读取下一层数据。

此外,框架支持使用两块 SSD 放置模型副本,以分摊读取压力。按照项目给出的测试结果,25GB内存的开发机在冷缓存状态下约为 0.05 至 0.1 token/s;128GB RAM 的纯 CPU 设备约为 1.8 token/s;使用多张高端 GPU、让更多专家常驻高速存储层后,速度可提升到约 5.8 至 6.8 token/s。这些数字反映的是项目测试条件,不能直接等同于通用硬件表现。

意义与限制

Colibrì的价值不在于让 SSD 真正拥有显存的速度,而在于改变了超大模型的部署门槛:容量最大的存储负责“装下全部模型”,RAM负责缓存热点,VRAM则承担最需要速度的部分。项目目前还覆盖 DeepSeek、Qwen、GLM、Inkling 和 Kimi K3 等模型,其中更大模型仍需要数百GB甚至TB级磁盘空间。

这意味着消费级设备有机会启动过去难以触及的模型,但启动、首次读取和持续生成速度仍取决于 SSD 性能、内存容量、专家复用率及模型结构。对研究者和开发者而言,这是一种值得关注的推理系统设计;对普通用户而言,它更像低成本实验平台,而不是高吞吐生产方案。

来源:量子位

评论

正在确认登录状态……

正在加载评论……

相关文章