AI资讯

国产超算跑DeepSeek大模型,16节点性能媲美80张GPU

智能摘要

其本质是把零散的算力硬件、模型、软件系统,整合为标准化、可量产、可交付的AI生产力。它充分证明,国产自主可控的超算硬件,搭配本土企业深耕打磨的自研推理软件与系统化优化能力,完全能够比肩主流GPU集群的大模型推理效能,实现高性能Token量产。

只是进行峰值数字的算力已不再是重点, 能够稳定产出Token才是关键所在。超算由科学计算转向AI生产, 这意味着国产算力迈入实用化新的阶段, 性价比方面的优势开始得以显现。

超算变身Token工厂

以往的时候, 超算仅仅是被应用于传统的科研范畴, 然而当下的情况却是, 它能够做到持续不断地去生产大模型Token。 这种情形, 不仅仅是属于技术层面所实现的突破, 更加是演变成了算力用途方面的根本性转变。 硬件所具备的潜力由此被再度挖掘出来, 进而成为了AI服务的核心产能基地。

软硬协同优化是关键

仅靠单纯的硬件峰值并没有办法去反映真实的生产力, 得要借助深度的软件适配, 以及算子优化, 还有通信协同, 才能够打通从算力到Token的完整链路, 进而让国产硬件切实转化为能够用于商业用途的AI能力。

纯CPU实现高效推理

清程极智借助灵晟平台, 顺利完成纯CPU类的MoE模型部署, 十六个节点能够流畅运行六百七十一B参数的模型, 输出吞吐量可与八十张主流GPU集群相媲美, 证实了国产CPU在大模型推理方面的潜力。

多维度并行策略加速

团队依据LX2 CPU特性, 对此进行算子重构而后实施混合并行, 运用EP256配置, 把张量并行、流水线并行以及数据并行相结合, 以此充分释放算力密度, 与此同时引入MTP技术, 利用一次推理产生多个Token的方式, 进一步提升输出速率。

建立全新算力评价体系

Token服务有着一个并非寻常的要求, 那就是要跳出传统评价的那种思维模式。其不再只是单纯地去比拼节点数, 也不再只是单纯地去比拼峰值, 还要借助单位算力, 考量能耗, 顾及成本, 以这些条件当下的Token产出效率, 以及推理时延, 还有服务所具备的稳定性, 进而去对价值产生衡量, 最终建立起标准化的生产评价体系。

国产化生态持续完善

这次合作呈现出了, 从硬件适配开始, 一直到Token产出的, 全链路能力。伴随国产算力生态的发展, 清程极智会持续地, 深入进行软硬协同的优化, 促使国产算力, 朝着“好用、高产、低成本”的方向逐步迈进。

你认为国产算力于成本优势方面, 能不能终究去替代进口GPU进而成为大模型推理里, 占据主流地位的选择? 欢迎展开留言讨论, 通过为之点赞及分享促使更多人知悉国产算力发生的突破。

相关文章