返回文章列表
推理与部署

vLLM接入Tenstorrent:一场围绕Mesh架构的推理改造

阅读约 3 分钟

导语

vLLM近日介绍了Tenstorrent插件,将这类加速器接入现有的vLLM服务栈。安装插件后,只要运行环境能够导入TT-Metal中的ttnn,Tenstorrent硬件就会被识别为vLLM平台。对使用者而言,服务接口基本不变:仍可采用OpenAI兼容API、原有请求格式和客户端代码。

但这并不是一次简单的“新增设备适配”。Tenstorrent以由核心和芯片组成的Mesh为基本执行单元,跨芯片数据移动由编译后的程序和片上互连网络完成,而不是由主机在每一层调用GPU式集合通信。因此,许多为GPU抽象设计的推理假设都需要重新处理。

核心要点

  • 插件而非代码分叉。 插件通过vLLM的标准平台和通用扩展点注册TTPlatform、工作器、调度器及模型架构。Tenstorrent特有配置放在additional-config中,没有向vLLM核心加入专用参数。
  • Mesh取代传统进程式并行。 在Tenstorrent路径中,模型针对整张Mesh编译和追踪。插件使用MESH_DEVICE选择设备,不接受传统的-tp-pp参数;并行策略由模型实现与Mesh形状共同决定。
  • 调度按阶段组织。 每个调度步只执行预填充、解码或空操作之一,不混合预填充与解码。长提示词仍可分块预填充,解码步骤可以穿插其中,以避免在长预填充期间停止已有请求。
  • 更重视形状稳定性。 设备执行主要依赖固定批次形状的追踪程序。同质、稳定的批次更适合这种执行模式,异构批次则可能削弱追踪复用带来的收益。
  • 采样可以靠近设备完成。 Mesh程序能够把采样延伸到执行末端,部分模式下主机直接收到选定token,而不必接收完整logits;同时也保留主机回退路径。
  • 模型覆盖不局限于纯文本。 插件支持多个Llama、Qwen、Mistral、Gemma等系列,也覆盖Llama Vision、Qwen-VL等多模态架构。模型注册还支持通过额外目录提供适配器,无需修改插件源代码。

意义与影响

这个项目的价值在于,它验证了vLLM插件边界对非GPU硬件是否足够通用。Tenstorrent并没有把自身执行模型强行伪装成GPU,而是将Mesh编译、阶段化调度和设备侧采样等差异保留在插件与TT-Metal模型实现中。这样既能复用vLLM的API和生态,也减少对上游核心的侵入。

对推理服务开发者来说,代价是需要理解新的约束:不能照搬GPU上的张量并行参数,批处理策略也要适应预填充和解码分离。对硬件厂商来说,这则提供了一条更可维护的接入路径——通过稳定的插件接口跟随vLLM演进,而不是长期维护一套落后的分叉代码。

最终,这一案例说明,推理框架的可扩展性不只体现在能否“识别一块新芯片”,还体现在能否容纳完全不同的执行模型。

来源:vLLM Blog

评论

正在确认登录状态……

正在加载评论……

相关文章