AI资讯

英伟达新芯片Vera Rubin NVL72:功耗降30倍,成本省35倍

智能摘要

AI时代,性能瓶颈早已不局限于单颗芯片的算力,而是横跨计算、网络、存储、供电、散热的系统性工程。CPU这款专门为Agentic时代设计的高性能处理器,其定制Olympus核心相较竞品的芯粒方案,单线程性能提升2倍、核间带宽提升3倍、内存延迟降低40%。

能效提升30倍的震撼数据

英伟达新芯片Vera Rubin NVL72:功耗降30倍,成本省35倍

最近, 英伟达发布了一组数据, 这组数据让行业感到震惊。在对1.6万亿参数的 -V4-Pro模型进行实测时, Vera Rubin NVL72的每兆瓦吞吐量, 相较于上一代GB300 NVL72, 直接提升了30倍。那么, 这个数字究竟意味着什么呢? 在同样为一兆瓦电力预算的情况下, 老机器所能完成的工作量, 新机器可以完成三十倍之多。

更值得予以特别关注并进行仔细研究, 且重点聚焦的是参照系, GB300在同款模型所开展的测试当中, 每兆瓦吞吐量已然相较于H200提升了15倍,也就是说, 从H200到GB300再到Vera Rubin, 英伟达恰恰就是在短短两代产品的情况之下, 把能效非常强硬地, 并且突破常规极大程度地推高了将近450倍, 对于那些受到电力供应方面限制的AI工厂而言, 这简直就是直接突破了物理法则所设定的限制。

英伟达新芯片Vera Rubin NVL72:功耗降30倍,成本省35倍

七款芯片的五重协同设计

存在着这样一种情况, Vera Rubin NVL72表现得极为惊人, 这种惊人表现并非是依靠单颗芯片堆砌出来的, 而是英伟达所宣称的那种被称作“极致协同设计”的结果;呈现出这样一种架构, 整个平台是经由由七款专用芯片以及五种专用机架来构成的架构, 其中涵盖了Rubin GPU、Vera CPU、NVSwitch 6、NVLink 9、NVLink 4 DPU、Spectrum – XG200以太网交换器, 另外还有Groq LP30 LPU。

这些组件并非是通用产品那种单纯拼凑而成的, 而是当作一个完整系统整体重新进行研发处理的。英伟达持有这样的观点, 在AI时代里性能瓶颈早就不是仅仅局限于单颗芯片的算力方面了, 那是一种横跨计算范围、网络领域、存储范畴、供电区域以及散热方面的系统性的重要工程内容。只有将所有环节都打通顺畅, 才能够切实真正地释放出算力的潜藏能力。

计算与内存的协同突破

于计算跟内存协同这一方面, 英伟达运用了两项关键技术, 其一为NVFP4量化技术, 它把模型权重压缩到4位精度, 在不使输出质量受损的状况下极大地削减了内存占用, 为吞吐量提高疏通了路径, 其二是分布式KV缓存技术, 它把内存扩充到了整个GPU集群。

系统与KV感知路由技术相配合, 将请求引向已缓存相关上下文的GPU, 避免了代价高昂的重复计算, 这种设计有何作用? 在大模型处理超长上下文时, 它能大幅减轻内存带宽压力、提高整体运行效率。那么之前传统架构情况如何? 内存常常充当着限制吞吐量的关键瓶颈角色, 而此次英伟达成功地把这个问题给破解了。

预填充与解码的分离革命

英伟达新芯片Vera Rubin NVL72:功耗降30倍,成本省35倍

另一关键设计乃预填充与解码的分离式服务, 这两种操作对硬件的需求差异显著, 预填充属计算密集型任务, 需处理大规模上下文, 解码为国访存密集型任务, 要以极低延迟持续生成Token, 将它们置于同一资源池混跑, 会导致结构性算力错配。

英伟达所采用的解决办法是进行彻底的分离, 即叫Rubin GPU去负责大规模的上下文处理行为, 而将极速生成Token这个任务指派给Groq LP30 LPU。在一个完整的机架级部署状况之下, 数量多达256个的LP30加速器借助超高带宽互连与GPU共同协作战斗把企业级规模的推理引擎构造出来。第三方的测试内容表明, 在处理10万Token长上下文的这种情况下, Groq LP30达成了每秒3400个输出Token的速度, 相比最接近的替代平台要快上四倍。

网络架构的革命性升级

于网络层面, 英伟达推出了第六代纵向扩展技术, 相较于通用以太网, 此项技术在处理复杂工作负载之际, 吞吐量提升幅度超过两倍, 延迟降低至三分之一, 数据包处理速率提升十倍, 这使得1.6万亿参数的MoE模型能够在72个GPU之间顺畅自如地调用不同的专家子网络。

在传统集群扩展到一定规模之时, 就需要增添第三层网络, 这会带来额外的延迟, 会出现抖动情况, 还会造成高昂成本。然而英伟达的方案却是如此这般, 就是把每台服务器的网络连接拆分成多条彼此独立的路径,以此去构建扁平形状的网络, 此种网络情况可扩展至512,000个GPU, 并不需要第三层交换。在那个八平面拓扑中, 单平面失效的状况下仍旧能够维持大约90%的总带宽, 硬件恢复的速度相较于软件方案而言要快11倍。

英伟达新芯片Vera Rubin NVL72:功耗降30倍,成本省35倍

推理成本断崖式下跌的未来

黄仁勋作出这般表示, 是在最近的活动之上, 先前旧有的AI跑分基准, 已然全都废止没用了。行业现在迫切需要全新的性能衡量标准, 并非是单纯的单次推理速度, 而是每兆瓦吞吐量以及每Token成本。英伟达凭借Vera Rubin NVL72所展示出来的, 并非仅仅只是一代更为强大的硬件, 而是一整套关于”AI工厂”的构建范式。

推理成本, 呈现出断崖式下跌, 幅度达到35倍的时候, 24小时不间断工作的数字员工, 将会成为现实, 面向消费者的超级应用, 也会迎来大规模的爆发。这表明企业和个人, 能够以更低的成本, 去部署大模型应用, AI会从实验室以及科技巨头的专利, 切实走向大众的日常使用。你认为推理成本降低35倍之后, 最先受惠的是哪个行业呢?

相关文章