智谱开源多模态模型GLM-5.3-Flash,性能强成本低仅十分之一定价
近日,智谱正式上线并开源GLM-5系列首款原生多模态模型GLM-5.3-Flash(320B-A18B),以领先性能与极致定价,推动前沿人工智能技术走向普惠。架构层面,模型采用稀疏注意力与线性注意力混合架构,为首个落地该方案的开源前沿模型,搭配流形约束超连接技术。
性能登顶,定价跳水
GLM 5.3 闪光版刚一发布便掀起了行业之中一番震动, 这款模型于 Index 测评里斩获了 57 分的数据, 其所取得的成绩跟 Opus 4.8持平, 并且在编程能力这一方面表现得同样十分出色, 更有甚者值得予以关注的是, 它的综合性能居然超越了参数量更为巨大的 GLM 5.2。
在正式发布以前, 模型是以“Ox-Alpha”的匿名身份去参与公开测试的, 此后这一模型一下子就登上了各大平台的调用榜首位, 这种先是进行匿名测试然后再进行官宣的行为, 使得模型的实力经历了真实场景的验证。
价格优势碾压级

GLM – 5.3 – Flash的核心优势在于价钱, 它的定价只是同系列GLM – 5.3的十分之一, 限时优惠更是低到二十分之一, 折算下来, 这等同于Opus4.8价钱的四十分之一。
如此这般的定价策略, 极大程度大幅度地降低了前沿模型的使用门槛, 此前唯有少数大企业才能够负担得起的高级AI能力, 现如今中小企业乃至个人开发者均可以使用了, 这象征着国产大模型正式迈入普惠时代。
架构创新降本增效
模型运用稀疏注意力以及线性注意力相混合的架构来构成, 它是在该方案实现落地最先开源的前沿模型, 此模型搭配了流形约束超连接技术, 和前代模型相较而言, 注意力计算量降低到原来的三分之一左右, KV缓存减少为原来的四分之一左右。
这种架构的设计, 兼顾了长上下文的能力, 以及推理成本的控制, 对于那些需要处理超长文档的用户而言, 对于那些需要应对复杂任务的用户而言, 这意味着, 既能确保效果, 又能够有效地控制费用。

多模态能力全面进化
GLM – 5.3 – Flash 将视觉能力进行原生融合, 不再需要另外的视觉模块, 该模型能够自己利用视觉反馈去完成前端开发任务、完成3D建模任务、完成文档创作任务等。
对于金融研报分析、法律文书审查这类专业场景而言, 模型的表现极为突出, 用户只要上传图片或者文档, 模型便能够自动识别其中内容进而完成任务, 这极大地提升了专业工作的效率。
国产算力全线支撑
此处需要留意的是, 模型全部的流量是由国产的芯片集群来进行承载的。那个团队自己研究开发了推理引擎, 它是依靠EPD分离架构以及多项内存优化方案的, 从一端到另一端的推理性能提高了3倍。
硬件运用效率与英伟达具主流地位的GPU不相上下了, 这样一种成果证实了本国生产的算力能够支持大规模处于前沿位置的模型进行推理的可能性。在国内自身生产来取代国外产品的大环境前提下, 这对于整个人工智能产业而言都有着重大的意义。
全面开源降低门槛
GLM – 5.3 – Flash已全方位开源, 开放了API接口以及在线体验渠道。那模型同步上线于ZCode等智能Agent平台, 这一情况方便了开发者能够直接调用标点符号。
官方推出了每日万张体验卡,此体验卡面向全球开发者开放以供使用。用户能够通过Z.ai以及智谱清言App在线体验模型能力, 其达成了前沿AI技术的普惠化这样的情况。
试问, GLM – 5.3 – Flash这般极低的定价情形, 究竟会以怎样的方式去改变你的工作日常? 欢迎于评论区之中分享你的相关想法!