vLLM 在 Arm CPU 上提速:从“能跑”走向高效推理
vLLM 团队与 PyTorch、oneDNN、KleidiAI 等社区协作,系统优化 Arm Neoverse 服务器上的大模型推理栈。改进覆盖预构建包、分页注意力、内存分配、线程同步和 BF16/INT8 推理支持。
阅读全文vLLM 团队与 PyTorch、oneDNN、KleidiAI 等社区协作,系统优化 Arm Neoverse 服务器上的大模型推理栈。改进覆盖预构建包、分页注意力、内存分配、线程同步和 BF16/INT8 推理支持。
阅读全文Ai2 在 Hugging Face 介绍了 OlmoEarth Platform,目标是让地球观测基础模型不只停留在开放权重,而能完成从微调、评估到大规模推理的完整落地。
阅读全文vLLM 与 Speculators 开源支持 P-EAGLE、DFlash、DSpark 三种并行草稿算法,试图把推测解码从“逐个生成候选 token”推进到“一次生成候选块”。这类方法的核心价值,在于降低草稿阶段的串行开销,并让大模型推理服务更容易扩展和调优。
阅读全文vLLM 宣布在 Kimi K3 权重公开当天提供服务支持,覆盖混合 KDA 缓存、投机解码、分离式部署以及 NVIDIA、AMD GPU 优化。对开发者而言,这更像是一份超大规模开源权重模型的推理落地清单。
阅读全文Runway 发布面向开发者的 Media Router,可按质量、速度、成本等偏好,为图像、视频、音频生成请求自动选择模型。此举显示生成式媒体竞争正在从单一模型能力,转向模型编排与基础设施能力。
阅读全文Hugging Face 上 IBM Research 的文章指出,模型路由在企业 Agent 中远比按任务难度分流复杂。真正有效的路由需要同时优化成本、质量、延迟、缓存和治理约束。
阅读全文这篇 arXiv 论文将模型优化从“选算法”改写为“解约束”的工程问题。作者用数据、延迟、内存、精度与再训练预算五个维度,帮助团队在量化、剪枝、蒸馏、PEFT 与推理优化之间做取舍。
阅读全文vLLM 宣布在 TML Inkling 发布首日即完成支持,覆盖 NVFP4 与 BF16 两个版本,并针对 1M 上下文、多模态输入和 MTP 推测解码做了大量优化。
阅读全文