返回文章列表
算力与芯片

云天励飞押注分阶段推理芯片:从单卡性能转向Token成本

阅读约 2 分钟

导语

在大模型应用从演示走向高频调用后,推理成本正成为算力产业的关键问题。云天励飞在WAIC上公布了未来两年多的AI推理芯片规划:DeepVerse100P、DeepVerse100D和DeepVerse100L三款芯片将分别面向Prefill、Decode以及Decode阶段的FFN环节,并在万卡异构集群中协同部署。

核心要点

  • 推理阶段被进一步拆分。 Prefill负责集中处理输入上下文,尤其在长上下文场景下更偏计算密集;Decode逐Token生成,对内存带宽、访存效率和尾延迟更敏感;在MoE等架构下,Decode内部的Attention与FFN也呈现不同资源需求。
  • 三款芯片对应不同瓶颈。 DeepVerse100P面向百万级上下文Prefill,目标是减少长上下文处理与生成阶段共享资源带来的干扰。DeepVerse100D面向Decode,强调更高内存带宽、1024卡Scale-up和光互联系统,以缓解多节点通信阻塞。DeepVerse100L则聚焦Decode FFN,采用3D Memory架构和低延迟芯片互联,提升计算与通信并行效率。
  • 重点转向集群级协同。 云天励飞的方案并非只强调单颗芯片,而是把Prefill、Decode、FFN拆成不同资源池,通过高速互联形成“推理工厂”,以提升Token生成全过程的利用率。
  • 软件栈承担落地压力。 IFWA将支持PyTorch ATen、vLLM、SGLang等主流接口和框架,并覆盖量化、压缩、编译、部署等流程。公司还提到开源Houmao多Agent异构编程框架,以及将Triton算子能力融入FlagOS,降低国产算力适配门槛。

意义与影响

这一路线反映出推理芯片竞争正在从“谁的峰值算力更高”,转向“谁能更稳定、更便宜地产生Token”。当上下文变长、Agent任务链路变复杂,通用算力混部容易带来资源抢占和尾延迟,分阶段专用化有机会提高效率。

不过,这类异构路线也对调度、编译、模型适配和生态兼容提出更高要求。芯片能否真正降低成本,不只取决于硬件参数,还取决于软件栈成熟度、集群验证规模以及产业链协同。云天励飞提出“百亿Token一分钱”的长期目标,更像是一个方向性指标:国产AI算力要从“能跑模型”,进一步走向可规模化、可运维、可计价的推理基础设施。

来源:InfoQ 中文

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
英伟达押注联发科:让定制芯片也离不开自己的AI基础设施
算力与芯片
cctest.ai
算力与芯片

英伟达押注联发科:让定制芯片也离不开自己的AI基础设施

英伟达向联发科投资35亿美元,并将开放NVLink Fusion生态,帮助后者为云厂商和AI公司开发可直接接入英伟达数据中心的定制芯片。这笔交易显示,面对大型科技公司自研芯片,英伟达正从GPU供应商转向AI基础设施平台方。

阅读全文