英伟达的AI优势,正从GPU扩展到整套数据中心系统
导语
过去几年,英伟达在AI基础设施市场的故事,主要围绕一件事展开:它掌握了领先GPU,并在生成式AI需求爆发时获得了巨大的规模优势。但随着亚马逊、谷歌等云服务商开发自研芯片,市场开始关注英伟达的GPU优势是否会被削弱。
一个正在形成的新判断是,英伟达的护城河并不只在GPU本身。随着AI训练和推理集群扩大到千兆瓦级别,如何让计算、内存、存储和网络高效协作,正变成同样重要、甚至更难解决的问题。
核心要点
- 瓶颈从算力转向数据调度。 GPU需要持续获得恰当的数据。如果数据无法及时送达,昂贵的计算资源就会处于等待状态。数据中心规模越大,流量管理和跨设备协同越复杂。
- 英伟达正在销售“系统”而非单一芯片。 其Vera Rubin架构包括Rubin GPU、Vera CPU,以及面向推理、存储和网络的配套组件。它们的目标不是简单增加处理器周期,而是让GPU之外的环节运行得更顺畅。
- Vera CPU承担数据编排角色。 根据英伟达的说法,Vera CPU可帮助提升相关存储操作效率,使闪存性能得到更充分利用,减少存储与计算之间的瓶颈。原文援引英伟达高管称,部分操作的表现可获得最高约三倍提升,但这一说法仍属于厂商披露,应结合具体工作负载理解。
- 竞争者选择了不同路线。 OpenAI开发的Jalapeño芯片强调在更大的连接域内完成工作负载,以减少芯片之间的数据移动和通信延迟。它与英伟达的系统编排方案路径不同,但都指向同一个目标:用更聪明的数据流动方式提升效率。
意义与影响
这意味着AI芯片竞争正在向更高层次移动。过去,厂商主要比较GPU的计算能力、内存容量和能效;今后,数据中心能否让每个部件保持高利用率,可能成为更关键的评价标准。存储控制器、网络互连、CPU、软件栈和机架级设计,都会影响最终的每瓦输出和整体成本。
对英伟达而言,这一趋势提供了对冲GPU竞争的机会。即使云厂商在部分场景采用自研加速器,它们仍然需要解决大规模系统中的数据搬运、通信和调度问题。英伟达若能把这些组件与软件生态整合起来,就可能继续掌握系统层面的优势。
不过,这并不意味着优势已经固化。超大规模数据中心的编排仍会吸引芯片公司和云服务商参与,减少数据移动的专用架构也可能成为另一条有效路线。真正的竞争焦点,正在从“谁拥有更快的GPU”转向“谁能让整个AI系统更少等待、更高效地工作”。
评论
正在确认登录状态……
正在加载评论……