9 月廊坊算力大会:国产 GPU+类脑芯片混合推理系统发布
中国算力大会在河北廊坊举行。类脑芯片大模型异构混合推理系统正式发布。以上。代码生成、多智能体协同、智能制造等高实时性场景,同时面向金融、安防、通信等安全敏感行业,提供全栈国产化推理底座。拆分,不同模块部署到最擅长的芯片上。GPU,发挥其通用计算优势。的架构优势。推理的固有瓶颈。
大模型推理成本砍半
2026年中国算力大会于9月13日在河北廊坊正式闭幕, 此次会上发布的一项重量级成果——国内首个国产GPU搭配类脑芯片的大模型异构混合推理系统, 已正式亮相。
这绝非一般的性能升级, 而是成本构造的颠覆。V4实测数据昭示, 这套系统的性价比比纯国产GPU集群高出一倍有余, 业务运营成本直接降低四成以上。
五家单位联合攻关
这套系统的研发阵容相当豪华。移动云公司作为牵头牵头方, 联合了中国中国电子科技南湖研究院、北京、北京灵汐科技、上海天数智芯, 还有清华大学和北京大学共同共同参与。
这种产学研用一体化的合作模式, 既保障了技术深度, 又保障了应用落地能力。国产GPU和类脑芯片产于不一样厂商, 能在一个系统之内协作工作, 本身上就讲明了不少事情。
核心思路分而治之
这套系统的核心逻辑明明白白的——分而治之, 共同增效, 大模型被切割成PD和AF两个部分, 不一样模块放到最擅长久地去执行呢?
将需被完成的计算密集型任务托付予国产GPU器具, 发挥好它那能做通用数值处理的各类长处;那如FFN一般的MOE专家种类型的对响应时长极度敏锐的功能组件, 就交与类脑类的芯核器件开展运算, 借此用上具备存算一体化设置及片上带大容量部件SRAM装置架构带来的特出好处。
三大关键技术支撑
自研模型、编译器负责把, 模型智能拆分高速互联!协议!保障两块芯片之间的数据传输效、率, 统一推理引擎完成任务, 调度与结果、聚合…
这三者搭配联动起来彻头彻尾打破了传统单GPU推理时的性能桎梏。从前想要提升算力只能堆砌显卡硬件, 当前则可以改换别种玩法模式, 让不一样类别的芯片各显神通。
应用场景广泛覆盖
Token工厂处理领域、AI代码生成领域、多智能体协同领域以及智能制造领域都是高实时性场景, 这套系统正好对这一点极其敏感的高实时性场景派上有用来场。
金融、安防、通信这些涉及安全的敏感性行业, 更需要具备自主属性、掌控得的技术底座。全栈实现国产化的这个推理方案, 正好能够契合住他们的所需所求。
打破单GPU依赖困局
曾时国产大模型的推理工作基本只能够依靠大量堆叠GPU, 成本偏高且瓶颈极为明显。现下具备了异构配合方案, 各类芯片之间可以展开协同式作战, 不再一根道直线行走究竟。
这对整个产业意指着什么? 大模型落地门槛之低下, 中小企业也玩得起推理服务了? AI之应用会更快普及到更多更多的行业? 这套系统会在什么些个场景最先大规模落地?