返回文章列表
推理与部署

FreeToken:让个人电脑承载更大规模 MoE 模型

阅读约 2 分钟

导语

开放权重模型越来越强,但它们的实际部署仍常以数据中心 GPU 为前提。对个人用户而言,显存容量、内存带宽、CPU 与 GPU 之间的数据搬运,以及不断增长的 Agent 状态,往往比模型参数规模本身更先成为瓶颈。FreeToken 试图改变这一思路:个人电脑不必被看作一块性能较弱的 GPU,而可以被组织成一个包含多种资源的弹性推理平台。

核心要点

  • 围绕 MoE 的稀疏计算重新设计服务栈。 FreeToken 同时处理模型布局与加载、专家驻留、CPU-GPU 执行、Agent 状态复用和运行时内存管理,而不是只优化某一个算子或单一卸载策略。
  • 根据实际硬件动态调度。 不同电脑的显存、系统内存、处理器能力和数据传输带宽并不相同。系统不预先固定“哪些层放 GPU、哪些层放 CPU”,而是持续把计算和模型状态映射到当前可用资源上。
  • 关注真实 Agent 工作负载。 编码 Agent 和工具调用 Agent 的执行路径会持续变化,专家访问模式也不会始终稳定。FreeToken 将这种变化纳入运行时设计,并尝试复用已经产生的 Agent 状态。
  • 扩大本地可运行模型的范围。 论文称,系统支持超过 20 个 MoE 模型,并覆盖从 8GB 显存笔记本到单工作站 GPU 的硬件环境。其展示目标包括在笔记本上运行 35B 模型、在游戏电脑上运行 284B 模型,以及在单工作站 GPU 上运行 753B GLM-5.2。

意义与影响

FreeToken 的价值不只是“把更大的模型塞进更小的设备”。更重要的是,它把本地推理看成一个带宽和状态管理问题:当模型参数无法全部驻留显存时,系统需要判断哪些专家值得常驻、哪些状态应被复用,以及何时让 CPU、GPU 或其他存储资源参与执行。对于 MoE 模型来说,激活参数通常少于总参数,但专家权重的加载和移动仍可能决定响应速度,因此动态调度比简单切分更有意义。

这一路线也可能推动开放权重模型从“可以下载”走向“可以部署”。不过,素材只说明了支持范围和代表性运行目标,并未提供统一硬件下的吞吐、首 token 延迟、持续生成速度或能耗对比。因此,这些规模数字更适合被理解为系统能力展示,而不是对所有个人电脑都适用的性能承诺。FreeToken 已通过项目页面和代码仓库发布,后续实际体验仍取决于具体模型、硬件配置及工作负载。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
退役 GPU 还能做什么?DumpsterCluster 探索用二手硬件运行 LLaMA-70B
推理与部署
cctest.ai
推理与部署

退役 GPU 还能做什么?DumpsterCluster 探索用二手硬件运行 LLaMA-70B

牛津大学研究团队用 128 张二手 GPU 搭建 DumpsterCluster,验证了退役硬件服务大模型推理的可行性。研究同时指出,低采购成本并不等于低总成本,电价与电力碳强度将决定这类方案是否真正划算。

阅读全文