英伟达新芯片Vera Rubin NVL72:功耗降30倍,成本省35倍
AI时代,性能瓶颈早已不局限于单颗芯片的算力,而是横跨计算、网络、存储、供电、散热的系统性工程。CPU这款专门为Agentic时代设计的高性能处理器,其定制Olympus核心相较竞品的芯粒方案,单线程性能提升2倍、核间带宽提升3倍、内存延迟降低40%。
能效提升30倍的震撼数据

最近, 英伟达发布了一组数据, 这组数据让行业感到震惊。在对1.6万亿参数的 -V4-Pro模型进行实测时, Vera Rubin NVL72的每兆瓦吞吐量, 相较于上一代GB300 NVL72, 直接提升了30倍。那么, 这个数字究竟意味着什么呢? 在同样为一兆瓦电力预算的情况下, 老机器所能完成的工作量, 新机器可以完成三十倍之多。
更值得予以特别关注并进行仔细研究, 且重点聚焦的是参照系, GB300在同款模型所开展的测试当中, 每兆瓦吞吐量已然相较于H200提升了15倍,也就是说, 从H200到GB300再到Vera Rubin, 英伟达恰恰就是在短短两代产品的情况之下, 把能效非常强硬地, 并且突破常规极大程度地推高了将近450倍, 对于那些受到电力供应方面限制的AI工厂而言, 这简直就是直接突破了物理法则所设定的限制。

七款芯片的五重协同设计
存在着这样一种情况, Vera Rubin NVL72表现得极为惊人, 这种惊人表现并非是依靠单颗芯片堆砌出来的, 而是英伟达所宣称的那种被称作“极致协同设计”的结果;呈现出这样一种架构, 整个平台是经由由七款专用芯片以及五种专用机架来构成的架构, 其中涵盖了Rubin GPU、Vera CPU、NVSwitch 6、NVLink 9、NVLink 4 DPU、Spectrum – XG200以太网交换器, 另外还有Groq LP30 LPU。
这些组件并非是通用产品那种单纯拼凑而成的, 而是当作一个完整系统整体重新进行研发处理的。英伟达持有这样的观点, 在AI时代里性能瓶颈早就不是仅仅局限于单颗芯片的算力方面了, 那是一种横跨计算范围、网络领域、存储范畴、供电区域以及散热方面的系统性的重要工程内容。只有将所有环节都打通顺畅, 才能够切实真正地释放出算力的潜藏能力。
计算与内存的协同突破
于计算跟内存协同这一方面, 英伟达运用了两项关键技术, 其一为NVFP4量化技术, 它把模型权重压缩到4位精度, 在不使输出质量受损的状况下极大地削减了内存占用, 为吞吐量提高疏通了路径, 其二是分布式KV缓存技术, 它把内存扩充到了整个GPU集群。
系统与KV感知路由技术相配合, 将请求引向已缓存相关上下文的GPU, 避免了代价高昂的重复计算, 这种设计有何作用? 在大模型处理超长上下文时, 它能大幅减轻内存带宽压力、提高整体运行效率。那么之前传统架构情况如何? 内存常常充当着限制吞吐量的关键瓶颈角色, 而此次英伟达成功地把这个问题给破解了。
预填充与解码的分离革命

另一关键设计乃预填充与解码的分离式服务, 这两种操作对硬件的需求差异显著, 预填充属计算密集型任务, 需处理大规模上下文, 解码为国访存密集型任务, 要以极低延迟持续生成Token, 将它们置于同一资源池混跑, 会导致结构性算力错配。
英伟达所采用的解决办法是进行彻底的分离, 即叫Rubin GPU去负责大规模的上下文处理行为, 而将极速生成Token这个任务指派给Groq LP30 LPU。在一个完整的机架级部署状况之下, 数量多达256个的LP30加速器借助超高带宽互连与GPU共同协作战斗把企业级规模的推理引擎构造出来。第三方的测试内容表明, 在处理10万Token长上下文的这种情况下, Groq LP30达成了每秒3400个输出Token的速度, 相比最接近的替代平台要快上四倍。
网络架构的革命性升级
于网络层面, 英伟达推出了第六代纵向扩展技术, 相较于通用以太网, 此项技术在处理复杂工作负载之际, 吞吐量提升幅度超过两倍, 延迟降低至三分之一, 数据包处理速率提升十倍, 这使得1.6万亿参数的MoE模型能够在72个GPU之间顺畅自如地调用不同的专家子网络。
在传统集群扩展到一定规模之时, 就需要增添第三层网络, 这会带来额外的延迟, 会出现抖动情况, 还会造成高昂成本。然而英伟达的方案却是如此这般, 就是把每台服务器的网络连接拆分成多条彼此独立的路径,以此去构建扁平形状的网络, 此种网络情况可扩展至512,000个GPU, 并不需要第三层交换。在那个八平面拓扑中, 单平面失效的状况下仍旧能够维持大约90%的总带宽, 硬件恢复的速度相较于软件方案而言要快11倍。

推理成本断崖式下跌的未来
黄仁勋作出这般表示, 是在最近的活动之上, 先前旧有的AI跑分基准, 已然全都废止没用了。行业现在迫切需要全新的性能衡量标准, 并非是单纯的单次推理速度, 而是每兆瓦吞吐量以及每Token成本。英伟达凭借Vera Rubin NVL72所展示出来的, 并非仅仅只是一代更为强大的硬件, 而是一整套关于”AI工厂”的构建范式。
推理成本, 呈现出断崖式下跌, 幅度达到35倍的时候, 24小时不间断工作的数字员工, 将会成为现实, 面向消费者的超级应用, 也会迎来大规模的爆发。这表明企业和个人, 能够以更低的成本, 去部署大模型应用, AI会从实验室以及科技巨头的专利, 切实走向大众的日常使用。你认为推理成本降低35倍之后, 最先受惠的是哪个行业呢?