AI资讯

智谱GLM-5.3发布!编程比肩Claude,开源模型新王

智能摘要

大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。的新能力包括:5,编程体感超过其他国产模型。评估模型在真实编程场景中的综合体感。等编码平台开放抢先体验。很快上线,完整模型权重将在两周内开源,此前需完成必要的安全加固,尽可能限制其潜在攻击能力,保留其防御价值。

智谱于今日发布了GLM – 5.3 , 其基座并未发生改变 , 不过借助后训练的方式将上限予以了拉高。多项测试表明 , 它在当前开源模型当中属于排名最为靠前的 , 国产编程所带来的体验可说是无与伦比的。

基座不变后训练拉满

有着同一个基座模型的GLM – 5.3与GLM – 5.2, 这二者的不同之处在于后训练环节有着极具幅度提升的进程扩展, 智谱将长程任务环境提升至数十倍之多, 环境类型更为多样丰富, 后训练时间远远超越了前代版本。

这般打法表明基座能力已然达成, 真正致使差距拉开的乃是后训练阶段。借由更为多样化的场景以及更为长久的训练, 模型的智能之上限被显著抬高。

编程测试跑赢Opus 4.8

智谱自己研究制作的Z.ai Code Bench评估模型将其在真实编程场景里的综合表现展现出来, 该模型被放置到复杂的本地开发环境当中, 在不同的思考档位之下才完成端到端任务, 这种情况更接近开发者实际去使用Agent的体验。

GLM – 5.3在High档位时, 准确率达到31.4%, 此准确率超过了Opus 4.8于其最高档位所能达到的29.5%。并且每件任务平均仅输出大致5万Token, 而Opus 4.8 需要将近12万, 在效率方面差距显著。

效果与成本更均衡

GLM – 5.3于效果以及Token利用率之间寻觅到了更为优良的平衡点, 在准确率更高之际, 其输出的Token数却更为少些, 这意味着达成任务的路径更为短捷。

于开发者而言, 这表明相同的资金能够运行更多的任务, 又或者同样的任务所需花费更少。在按Token计费的API模式之下, 这个优势会直接在账单上面体现出来。

多平台同步上线

就在今日起, GLM – 5.3已经在智谱官方编程工具ZCode以及效率工具上上线了, GLM Plan的全量用户, 还有开放订阅用户能够直接去使用。

多个编码平台, 诸如扣子、Qoder等, 也同步开启抢先体验, 予以开放。用户无需等待API, 此刻便能于实际项目里试用这款新模型的相关能力。

两周内开源完整权重

在需要完成必要的安全加固之后, 完整模型权重会在两周内被开源, 智谱方面宣称这样做的目的在于尽可能去限制模型的潜在攻击能力, 并且同时保留其防御价值。

此安排契合开源大模型的一贯行径, 先施行安全测试, 于排除高风险漏洞之后再放开源权重, 既具备 Responsibility 又显得稳健妥贴。

额度今天全量重置

从今日十三点整开始, GLM Plan全体人员额度重新设定。所有用户在后台的用量统计当中能够看到使用额度已恢复满额状态。这是智谱给予现有用户的一项福利, 同时也是针对新模型所展开的推广行为。

要是你始终都在留意国产大模型的开展进程, 现阶段GLM-5.3展现出来的那种表现是值得去跟踪关注的。那你会不会试着借助它去开展编程辅助工作, 又或者是用于别的任务?

相关文章