微软自研AI图像和语音模型上线,图像生成成本最高降84%
两款模型分别面向高质量图像生成与高并发语音交互场景,微软强调其训练数据经过清理和可追踪,不依赖第三方模型蒸馏,从底层设计就直接服务于微软产品用户。MAI-Image-2.5-Pro是微软目前精度最高的图像模型,面向主视觉图片生成、细节编辑及图像内文字渲染等高要求场景,支持自然语言编辑指令。
图像生成更省钱
7月23日, 发布了新的由微软自研的AI模型, 其中, 主打高质量图片生成的MAI-Image-2.5-Pro, , 现在已然成为了Bing图片生成的默认模型, 相较于之前的模型, 它能够大幅度地降低使用成本。
于处理细节以及文字渲染方面,此模型展现出极强表现。其支持借助自然语言径直对图片作出修改。于中部署之后, 保存成功率实现了提升, 提升幅度为26%。P95延迟降低幅度约达四分之一。于中等负载情况下, 效率获得提升, 提升倍数为2.5倍。

关于定价这一情况, 对于文本输入而言, 每百万Token收取5美元的费用。而对于图像输出来说, 每百万Token收取106美元的费用。尽管从单价方面看上去并非处于较低水平, 然而要是考虑到性能得以提升以及成本呈现下降的态势, 那么整体来看性价比表现得相当高。它适合那些对于画质有着严苛要求的用户。
语音交互更快速
另外一款名为MAI-Voice-2-Flash的模型, 着重聚焦于语音方面的场景, 它相对上一代, 速度提升至原来的两倍, 成本下降了百分之三十二, 极为契合像客服中心这类需要迅速做出回应的场所, 微软已然把它接入到365系统里。
此模型曾给多个有名的客户供应出服务了, GPU成本最多降低至百分之八十九了, 微软又把此样的它集进Azure Voice Live里了, 开发者能够借由它去构建从语音向语音的智能体了, 这致使实时对话变得越发流畅自然了。
应用在医疗领域的是同系列的MAI–1.5, 已有17万名医生在使用它, 上季度它处理了2800万次问诊记录, 它支持58种语言, 其转录错误率下降了一半, 这表明它的多语言能力极为实用。
底层设计更可控
微软着重表明, 这两款模型皆是其自行研发的, 训练所用数据是经过清理的, 并且是可追踪的, 不依靠第三方模型进行蒸馏, 从底层设计时便直接为产品用户提供服务, 这便意味着数据安全性是更高的。
很多风险能够藉由这种自主可控的路径予以避免。从而企业用户大可以不必忧虑数据泄露的隐题。与此同时, 鉴于其归属是直接服务于内部产品的缘故, 优化会显得更为精准。举例来说, 在Bing中的集成便缔造得契合无间。
投入运行的是下一代GB200计算集群, 它会支撑MAI系列模型持续扩展, 即将推出更多功能和更好性能, 这对关注AI发展的企业而言,是个值得留意的信号。
效率提升显著
精度方面达到最高水准的MAI – Image – 2.5 – Pro, 是面向主视觉图片生成场景的, 其细节编辑能力也十分突出, 图像内文字渲染效果逼真, 这些特性使其成为专业设计师所用之工具。
在运用之时, 有关场景的保存成功概率显著提高, 这表明生成失败的情形减少了。P95延迟下降表明用户等待时长缩短。于中等负载状况下效率提高了2.5倍。整体感受更为顺畅。

从开发者的角度而言, 这所蕴含的是更高的产出量。能够于更为短促的时间范围内达成更多的工作行为。然而成本却处于下降的态势中。这样一种效率与成本之间所形成的平衡状态, 是众多企业最为重视的。
应用场景广泛
MAI – Voice – 2 – Flash专门针对高频语音应用进行了优化, 它适用客服中心以及可以作为语音助手, 其关键优势在于具备快速响应能力, 因成本降低了32%从而使大规模部署成为可能。
在医疗领域当中已经证实出了它的价值, 它能够去处理大批量的患者那问诊记录, 它支援多种语言, 并且错误率是很低的, 基于此就说明了它在复杂场景之下也能够维持稳定, 在未来的时候可能会有更多的行业接入进来。
微软把它整合入多种产品里, 从搜索功能到办公套件, 这般全面的布局能将模型价值最大化, 用户能够于不同场景间进行无缝切换, 体验更为一致且高效。
下一代计算集群已被微软透露处于运行状态, MAI系列模型将会持续进行扩展, 这意味着在未来会有更多新功能上线, 性能还会得到进一步提升, 成本有可能会进一步降低。
对企业用户而言, 当下乃是知晓与研习的绝佳时刻, 能够预先拟订怎样去整合这些模型, 尤其是针对在成本以及效率方面较为敏感的情形, 微软的自主研发策略给予了更多的保障。
哪一些业务场景之内准备运用这些全新的模型, 你是有这样的打算的么? 评论这块区域里头, 请欢迎你去把自身想法予以分享出来。要是感觉有着某些用处的话, 麻烦请进行点赞这个动作, 并且分享给更多数量的人。