OpenAI揭示新推理系统Jalapeño,性能超越市面顶尖处理器
的更多细节,并首次披露基准测试成绩。处理量,还是每千瓦吞吐量,都超过了目前市面上的顶尖推理处理器。相比目前最先进的产品实现了非常显著的性能提升。超级芯片系统进行比较。看来往往是推理性能的主要瓶颈。缓存等模型状态可以明确存放并保留在本地,系统再根据不同推理阶段,调配合适的计算、内存和网络资源。
芯片性能创纪录
Hot Chips大会上, Google展示了全新的推理系统ño, 测试结果令人震惊, 这款芯片是Google和博通联合开发的, 在多个关键指标上, 超越了英伟达的GB200和GB300超级芯片系统。
吴理查德向媒体讲到, 对于测试结果而言, 最为关键的一点是, 性能的提升极为显明, 在相同电力的情形之下, ño能够针对更多的人工智能工作中因负载要求所需处治事务, 并与此同时给出响应更为快速的表现。

每瓦性能领先
将测试数据进行考量, 其在GPT – OSS 120B、R1以及Kimi K2.5 1T这三个模型的情形之下, ño所达成的每瓦之内的AI工作量, 是被用以形成对比的系统的1.5至1.9倍。
相比于英伟达系统, 端到端延迟仅为其28%到59%, 这表明在电量相同的情况下, ño能够执行更多计算任务, 并且速度更为迅速。
软硬件协同设计
ñ o 的研发存在一个关键的独特之处, 那就是 Google 本身所拥有的模型也介入了设计的进程之中。这一情况致使芯片以及软件能够在起始阶段便展开协同性的优化工作, 而非留待往后进行磨合工作。
Goole期望将ño打造为能够延续多代的技术平台, 使得AI产品, 以及模型, 还有芯片与内存, 从最初之际便可以实现完美配合, 进而减少各类兼容问题。
解决推理瓶颈
在AI推理的进程之中, 存在有两个极易致使速度被拖慢的环节, 分别是预填充阶段, 以及通信阶段。重点对这两个阶段的延迟予以了降低, 是直接朝着性能瓶颈之处着手的。
在系统设计起始之时, 便着手尽可能地去降低数据搬运的情况。诸如KV缓存这类的模型状态, 能够确切地进行存放, 并且留存于本地, 依据不同的推理阶段, 调配与之适配的计算资源、内存资源以及网络资源。
部署计划透露
Google披露了ño的布置时间规划表, 在本年年底之前会首先开展小小的规模布置, 给予切切实实实打实的用户率先去感受亲身经历体验一番, 直至2027年而后渐渐地递增扩大布局置放量。
然而, 明年究竟会投放多少芯片, Google对此并未给出确切数字。市场广泛地关注着, 这款芯片到底能不能着实撼动英伟达于AI芯片市场的地位。
阁下认为, ño所展现出的性能表现, 能不能够对AI芯片市场的竞争格局予以改变呢? 欢迎于评论区之中分享您自身的看法。