阿里真武V900曝光:算力翻3倍的国产AI芯片有多强?
2026云栖大会上,阿里旗下平头哥发布国产AI芯片真武V900,算力提升至上一代真武M890的3倍。阿里表示,随着平头哥芯片产品线逐步成熟并获得广泛客户应用,预计芯片年出货量将大幅提升。
在2026年云栖大会上, 平头哥把国产AI芯片的算力直接提升到了上一代的3倍, 50万卡的集群终于不再是PPT里画出来的数字。
真武V900算力翻了三倍
在9月23日举办的云栖大会上面, 平头哥这边就把真武V900这个芯片给正式发布出来了。它的峰值算力的情况是怎么样呢? 是达到了上一代的M890的那个东西的3倍那么高。它主要是面向那些前沿的大模型的训练和那个大规模的推理工作的。所以这也就是代表国产AI芯片完成了一次很关键的那个代际升级。
优采云AI将这段描述进行改写, 句子被拆分成多个以逗号分隔的分句。内容强调了V900型号在显存带宽、片间互联协议以及能效比方面的显著进化, 同时指出单芯片的峰值计算能力突破一千五百POPS, 处理相同量级任务时电能消耗幅度缩小接近三十分之一, 由此使得真实场景下的投入开销也随之出现下滑趋势。
50万卡集群到底什么概念
这个是基于V900所构建出来的单一集群。在最大规模的情况下是可以扩展到50万张计算卡的。如果按照当前比较主流的大模型训练需求来估算的话, 就相当于是可以同时进行好几十个千卡级别的并行任务。在这种情况下算力的储备是非常充足的状态是足够有余的状态。因此就不需要再去排队等待使用计算卡了。
这个规模的实现, 能够让训练周期从零碎的数周时间, 直接被压缩到仅剩几天的时长。与此同时, 推理端的单个Token成本也被大幅度地进行了摊薄操作。因为算力的问题得到了解决, 计算资源就不再是制约住模型迭代更新速度以及节奏的那个最主要的卡脖子的核心瓶颈因素了。
超节点已经规模化上架
吴泳铭在大会上透露, 自研超节点目前已经具备了支撑2万亿参数大模型推理的能力, 在这个季度期间已经于阿里云数据中心实现了规模化上架工作, 这表明其处于正式量产部署状态, 而非小批量试点。
超节点技术, 会将多颗V900芯片, 通过高速互联的方式, 打包成一个逻辑计算单元。这样做, 可以大幅度减少跨节点通信延迟。推理吞吐量, 相比单卡方案, 提升得非常明显。这一特点, 特别适合长上下文推理场景。
芯片出货量要放大一个量级
阿里那边已经把话说的非常明白了, 说是等平头哥的芯片产品线慢慢变得成熟, 并且能拿到更多来自外部的客户订单之后, 预计每年的芯片出货量会有大幅度的提升, 这意味着这些芯片不再仅仅用于阿里内部云业务的自给自足和内部使用。
在过去, 真武系列这个芯片,基本上只是会在阿里巴巴自己家里的那个数据中心里面去运行和使用的。那么到了现在这个情况是它已经正式开放给外部的客户来使用了。
这件事儿是有了这么个意义, 它就是意味着说国产的这个AI芯片的供应链这边, 是直接跨过了一个关键的一个步子。这个关键的步子是个什么样的步子? 是从自研这个阶段过渡到要开始实现商业上放量增长的那一步了。
端侧AI生态同步补上了
在同一个会议现场, 阿里巴巴方面还把千问2.7B小参数模型给开源了。同时它还正式推出了千问移动端AI解决方案。这一举动能把AI算力从云端服务器直接扩展到手机以及嵌入式终端设备上, 这样一来, 在端侧进行部署就不再是一个空乏的概念了。
2.7B的参数规模, 这个数值正好能够适配那些在端侧进行推理所需要的条件, 所以开发人员可以直接去下载它并调用它, 然后配合着V900在云端去把大规模的那些预训练步骤给完成掉, 这样一来, 整套叫做”云训端推”的技术闭环, 这种情况算是正式地被跑通实现了。
全链条算力争夺战开打了
阿里这次做的操作是从芯片设计起步, 接着深入到超大规模集群建设, 然后覆盖云端基础设施部分, 最终延伸到端侧模型生态, 这一系列动作把AI算力的整个链条一次性全部拉通。其中涉及到训练、推理以及部署这三个关键环节, 全部都实现了覆盖无遗漏, 并且整体的推进节奏相对于之前而言, 速度大幅加快。
针对国内人工智能行业而言, 关于国产芯片实现了由勉强能够使用到真正好用的这种转变的转折时期, 可能确实已经到来, 但是随后至关重要的情形, 依然完全取决于相关的第三方开发者所构建的支持体系是否能够同步发展起来,同时也取决于客户在实际业务中的再次购买行为所产生的具体统计数据。
你如何看待拥有50万张计算卡的集群是否能够支撑得起下一个万亿参数规模的大模型训练的需求? 请你在评论区域分享你的个人判断与分析, 如果觉得该内容对你有所帮助, 请点击点赞并按照分享操作流程进行传播推广。