RTX 4060 跑 35B 模型每秒 39 Token,FreeToken 想重做本地 MoE 推理
导语
大型混合专家(MoE)模型的总参数量不断上升,但普通用户通常只有一块消费级 GPU 和有限的系统内存。问题并不只是“显存够不够”,还在于每次生成 Token 时,模型需要把被路由到的专家权重及时送到计算设备。加州大学伯克利分校和麻省理工学院研究人员推出的开源推理引擎 FreeToken,试图从调度方式入手,缩小前沿 MoE 模型与本地硬件之间的差距。
它解决的是什么问题
稀疏 MoE 每次只激活部分专家,但专家权重可能分散在主机内存和 GPU 显存中。传统的静态卸载方式通常在缓存未命中时暂停 GPU,等待权重通过 PCIe 传输,主机内存延迟和有限带宽因此会直接拖慢解码。
FreeToken 的核心是名为 q* 的动态协同调度策略。当出现权重缓存未命中时,系统会根据实时互连吞吐量,在 CPU 核心与 GPU 张量核心之间重新分配工作,而不是让 GPU 完全等待。项目还使用快速权重格式 FTW 和整层双缓冲,使下一层权重传输能够与当前层计算并行进行。弹性内存管理器则可以在运行过程中调整 KV 缓存和常驻专家所占用的显存空间。
面向智能体的缓存设计
编程助手和自主智能体经常修改提示词、插入工具返回结果或生成新的思考内容。上下文一旦变化,传统引擎可能让线性 KV 缓存大范围失效,重新计算整段序列。FreeToken 引入语义锚点检查点,在任务边界保存部分注意力状态和循环激活值,从而在中间参数变化时复用可用的子序列状态。
论文数据与边界
根据素材所述论文基准,FreeToken 在配备 8GB 显存 RTX 4060 的笔记本电脑上运行 Qwen3.6-35B,速度约为每秒 39 个 Token;测试还覆盖了 RTX 5090 上的 DeepSeek-V4-Flash(284B)以及单块工作站 GPU 上的 GLM-5.2(753B)。项目目前面向 Linux 和 Windows,支持 NVIDIA RTX 30、40、50 系列 GPU,并提供命令行工具和桌面客户端。
不过,这些结果仍应结合测试配置理解。FreeToken 与 Ollama、llama.cpp 的优化目标不同,后者更侧重 GGUF 量化和逐层卸载;vLLM、SGLang 则主要服务于具备高带宽互连的数据中心场景。社区讨论也提出,闭式调度模型能否充分反映 CPU 调度延迟、内存争用和多智能体并发下的专家驻留变化,仍需要更多独立基准验证。
意义与影响
FreeToken 的价值不只是宣称某块显卡能运行更大的模型,而是把本地推理看作 CPU、GPU、显存和系统内存之间的协同调度问题。如果其方法在更多真实工作负载中成立,开发者就可能用更易获得的消费级硬件运行部分大型 MoE 应用,降低云端 API 依赖,同时保留本地数据处理的控制权。对本地 AI 生态而言,真正关键的下一步将是公开可复现的配置、统一基线,以及对并发和长上下文场景的持续测试。
来源:InfoQ 中文
评论
正在确认登录状态……
正在加载评论……