返回文章列表
推理与部署

TPU跑Kimi快57%,真正拉开差距的是推理软件

阅读约 2 分钟

导语

谷歌TPU能否在大模型推理中挑战英伟达GPU,关键未必只看芯片规格。Inferact发布的一组测试给出了一个颇具冲击力的结果:16块TPU v7 Ironwood运行Kimi K3,吞吐达到每秒709个Token;同样数量的GB200为452个Token,前者高出57%。不过,这更像是一场“软硬件协同”的胜负,而不是单纯的芯片性能排名。

测试看点

  • 两边使用相同的Kimi K3模型和vLLM推理引擎,主要变量是芯片以及底层Kernel实现。
  • TPU测试结合了DeepSeek提出的DSpark推测解码。小模型先提出候选Token,大模型批量验证,平均接受长度达到6。
  • 关闭推测解码后,TPU在Batch Size为1时达到249 Token/秒,GB200为127 Token/秒;Batch Size为8时,两者分别为865和636 Token/秒。
  • 在另一项测试中,4块TPU v7运行Qwen 3.8 27B达到1515 Token/秒,4块GB200为695 Token/秒。
  • Inferact称,TPU上的Kimi K3评测结果与GPU一致,GPQA-Diamond为94.4%,GSM8K为97.2%。

这些数据来自Inferact披露的基准测试,适合用来观察方案潜力,不应直接视为所有模型和服务场景中的普遍结论。

Megakernel为何重要

大模型解码往往受数据搬运限制。传统推理会把一层层计算拆成大量小Kernel,程序之间的启动和交接会造成带宽空转。Inferact的Megakernel则尝试把Kimi K3的多层计算合并到一个Pallas程序中,让当前层计算与下一层权重预取并行进行。

TPU的片上VMEM由软件管理,团队可以手动安排数据装载、缓存和释放。Inferact据此绕过更擅长单层优化的XLA,直接编排跨层数据流,并将编译时间从超过30分钟缩短到不到90秒。其公开代码还结合了DSpark推测解码,形成从硬件内存管理到解码流程的整体优化。

意义与限制

这项工作说明,推理竞争正在从“谁的峰值算力更高”转向“谁能更充分地利用数据流和内存系统”。对TPU而言,成熟的开源推理适配可能比单纯增加硬件规格更重要;对GPU而言,CUDA Graphs、PDL等机制也显示出类似的方向。

但Megakernel目前针对Kimi K3等特定结构定制,迁移到其他模型仍需重新适配。未来能否覆盖更多架构、稳定融入vLLM生态,并在真实服务中的延迟、成本和并发条件下复现优势,才是判断其商业价值的关键。

来源:量子位

评论

正在确认登录状态……

正在加载评论……

相关文章