云天励飞押注分阶段推理芯片:从单卡性能转向Token成本
阅读约 2 分钟
导语
在大模型应用从演示走向高频调用后,推理成本正成为算力产业的关键问题。云天励飞在WAIC上公布了未来两年多的AI推理芯片规划:DeepVerse100P、DeepVerse100D和DeepVerse100L三款芯片将分别面向Prefill、Decode以及Decode阶段的FFN环节,并在万卡异构集群中协同部署。
核心要点
- 推理阶段被进一步拆分。 Prefill负责集中处理输入上下文,尤其在长上下文场景下更偏计算密集;Decode逐Token生成,对内存带宽、访存效率和尾延迟更敏感;在MoE等架构下,Decode内部的Attention与FFN也呈现不同资源需求。
- 三款芯片对应不同瓶颈。 DeepVerse100P面向百万级上下文Prefill,目标是减少长上下文处理与生成阶段共享资源带来的干扰。DeepVerse100D面向Decode,强调更高内存带宽、1024卡Scale-up和光互联系统,以缓解多节点通信阻塞。DeepVerse100L则聚焦Decode FFN,采用3D Memory架构和低延迟芯片互联,提升计算与通信并行效率。
- 重点转向集群级协同。 云天励飞的方案并非只强调单颗芯片,而是把Prefill、Decode、FFN拆成不同资源池,通过高速互联形成“推理工厂”,以提升Token生成全过程的利用率。
- 软件栈承担落地压力。 IFWA将支持PyTorch ATen、vLLM、SGLang等主流接口和框架,并覆盖量化、压缩、编译、部署等流程。公司还提到开源Houmao多Agent异构编程框架,以及将Triton算子能力融入FlagOS,降低国产算力适配门槛。
意义与影响
这一路线反映出推理芯片竞争正在从“谁的峰值算力更高”,转向“谁能更稳定、更便宜地产生Token”。当上下文变长、Agent任务链路变复杂,通用算力混部容易带来资源抢占和尾延迟,分阶段专用化有机会提高效率。
不过,这类异构路线也对调度、编译、模型适配和生态兼容提出更高要求。芯片能否真正降低成本,不只取决于硬件参数,还取决于软件栈成熟度、集群验证规模以及产业链协同。云天励飞提出“百亿Token一分钱”的长期目标,更像是一个方向性指标:国产AI算力要从“能跑模型”,进一步走向可规模化、可运维、可计价的推理基础设施。
来源:InfoQ 中文
评论
正在确认登录状态……
正在加载评论……