蚂蚁百灵开源Ling-3.0-flash 124B参数混合推理模型
现已正式开源。架构。等多个版本,提供三种不同的落地选择:是门槛最低的接入方式。tokens/s。任务耗时”的优势区域。起恢复原价。
蚂蚁官方,昨天宣布, 新一代 Ling – 3.0 – flash 正式开源, 其有着 124B 参数, 可只激活 5.1B, MoE 架构使得成本直接降低, API 调用速度达到每秒 353 字, 比 OpenAI 的 GPT – 4o 快了整整 10 倍, 更厉害的是, 现在限时 2.5 折, 用下来每任务成本才 2 毛 7 人民币, 大模型价格战已然打到了这个地步。
这配置于往昔那是想都不敢想象的, 如今却径直置于开源社区之中。开发者无需再去烦扰纠结该选哪一个模型了, 速度、成本以及效果他们一项都不能放过非得全都要。在8月7号至31号这段时间内申请API, 价格将会被直接削减至原来的四分之一。到9月1号之后便会恢复原本的价格, 那些想要趁机占便宜薅羊毛的可得紧紧抓住这为期半个月的窗口期了呀。
开源背后的算盘
这次蚂蚁开源Ling – 3.0 – flash, 从表层看是返回给社区, 实际上是在争夺开发者的心智。大模型的赛道变得越发内卷, 仅仅依靠闭源API已经不行了。开源意味着你的代码能够在别人的模型上运行, 不过前提是那个模型要足够好用。353字的输出速度, 直接去对标甚至超过GPT – 4o, 这就是最为有力的广告。
尤为关键的是成本, 人民币两毛七一个任务, 将此价格纳入考量,中小企业以及独立开发者根本就没办法去作出拒绝, 先前运用大模型的时候, 预算常常会被 API 调用费大量消耗, 如今蚂蚁把价格压低到极致, 这等同于给整个行业确立了一个全新的标杆, 其他厂商要不跟着降低价格, 要不就会被市场给淘汰掉。
三种版本怎么选

提供基础版、有着FP八、FP四、INT四这四个不同版本, 覆盖不同场景需求, 基础版适合对精度要求高的场景, FP八在性能与成本之间达成平衡, FP四和INT四属于极致压缩版本, 适合对延迟敏感的应用, MoE架构使124B参数的模型仅激活5.1B, 这便是成本能压低到如此程度的原因。
对于那些期望能够迅速验证产品的团队而言,直接运用 API 此种方式会是最为省事的做法。其无需自行去进行部署, 也不用对服务器展开维护, 仅仅按照所使用的量来支付费用便即可。要是针对大规模应用的情况, 那么可以纳入考量去下载开源版本然后自行开展部署工作, 从长远的角度来看这样成本会更低。然而需要着重留意的是, 自行部署是需要具备一定的技术能力的, 并非是所有的团队都能够顺利操作做到的。
2.5折优惠能省多少
从8月7号起至31号, Ling – 3.0 – flash的API调用可享受2.5折优惠, 假设存在一个应用, 其每天有1000次调用行为, 每次调用平均成本为2毛7, 原本价格大概是1块左右, 在打折后仅需6毛7, 一天能节省3毛3, 一个月下来能节省将近10块, 对于高频调用的场景而言, 这个差距会十分显著且可观。
更为关键的是, 此折扣期恰好涵盖了双 11来临之前的准备期限, 诸多电商、营销类别的应用在 9月至 11月之际会迎来流量的高峰时段, 在这个时候运用折扣期的 API, 既能够确保性能, 并且还能够把控成本, 9月 1号恢复原价之后, 若想要回头再去购买便不会再有这个价格了。

和GPT-4o的硬碰硬
速度为每秒三百五十三字的那种输出, 比GPT – 4o要快上十倍, 这可不是个小数目。于实时对话、代码生成以及数据分析这些场景当中, 速度就是体验所在。用户等待一秒和等待十秒, 其感受是全然不一样的。倘若蚂蚁这个数据是真实不虚的, 那对于OpenAI所造成的压力将会极其巨大的。

诚然, 速度仅是其中的一个方面, 智能水准、稳定性、生态支撑均颇为关键, 然而在成本这一范畴, 蚂蚁此次着实践行到淋漓尽致, 人民币两毛七完成一个任务,此价格于当下的大模型市场里近乎是独一无二的, 其他的厂商若要展开竞争, 要么降低价格, 要么提高实力, 这两条途径都绝非易事。
开源社区的反应
Ling – 3.0 – flash开源完毕之后, GitHub上面的Star数量已然突破一万, 这表明开发者的关注程度是非常高的。好多团队已经着手开始测试, 反馈一般是速度足够快、成本足够低。然而也存在一些声音怀有担忧, 蚂蚁把这个模型进行开源, 是不是打算借着开源来占据市场, 然后借助API获取利润。这种商业模式自身是没有问题的, 可开发者会留意后续的政策变动。
再者, 开源版本跟API版本两者之间的差别同样是需要予以留意的, 开源版本有可能欠缺某些优化之处, 或者是在特定的场景里头其表现比不上API版本这件事。做出建议让开发者事前进行小规模测验, 对效果予以查证验收之后再向大规模范围来接入。毕竟, 模型好坏用起来顺不顺手, 唯有自己先试过了才可得出结论的。

适合哪些应用场景
Ling – 3.0 – flash格外适配于那些诉求为高并发以及低延迟的应用, 像是智能客服此项场景, 还有实时翻译这一情形, 另外代码助手以及数据分析这类状况, 它们对于速度均具备颇高要求, 2毛7的成本, 这表明能够开展大规模的部署, 无需担忧费用出现爆炸式增长的状况。就初创公司以及小团队而言, 这般的价格门槛基本上能够予以忽略不计。
但存在一些场景并非十分适宜, 像那种对精度方面有着极高要求、涉及复杂推理的任务而言, 或许依旧是闭源模型更为可靠。Ling – 3.0 – flash所具备的优势实则在于速度以及成本, 并非是绝对的智能水准。开发者应当依据自身业务的需求状况,去挑选恰当的模型, 切不可盲目地追求参数的大小。
这次蚂蚁所进行的开源Ling – 3.0 – flash的行为, 究竟会不会对大模型市场的格局产生改变呢? 你认为对于二毛七一个任务这样的价格, 它还有下降的空间存在吗?