AI资讯

微软MDASH系统网安测试成绩断层第一,成本更低优势明显

智能摘要

而拿下它的,不是一个前沿模型,而是微软的MDASH系统。更狠的是价格:MDASH的成本,只有微软此前最强配置的一半。其中,竞争对手最难抄的是数据。微软造出了自己的安全模型,本想少依赖点OpenAI。如今花30美元跑一次公开模型,也能复现出Mythos级别的漏洞狩猎。

微软的MDASH系统, 于网络安全基准测试里, 获得了95.95%的分数, 将GPT – 5.5 Cyber、GPT – 5这个前沿模型, 还有另外两个前沿模型, 共计四个前沿模型, 甩在了背后。更令人意想不到的是, 此成绩并非依靠堆砌最贵的模型达成, 而是凭借一个激活参数仅有5B的小模型, 承担了九成任务, 成本仅是此前最强配置的一半。

小模型扛大梁

MAI – Cyber – 1 – Flash, 这是微软凭借自身力量打造的首个网络安全模型, 其总参数为137B, 然而, 激活参数仅仅只有5B。它属于微软代码模型MAI – Code – 1 – Flash的网络安全领域专用微调版本, 专门被用于处理高频且重复出现的安全扫描任务。

微软AI的掌门人苏莱曼, 在介绍MDASH的时候讲, 这个5B的小模型, 最多能够处理九成的查询, 剩下最难的那10%, 交给比它大概大10倍的GPT – 5.4来收尾。这样的一种分工, 是便宜且好用的小模型顶在前面, 旗舰模型只处理疑难杂症。

成本账怎么算

每天, 攻击如潮水不断涌来, 而需扫的代码似一座持续堆高的山那样。在此情形下, 真切卡脖子的并非模型是否够聪明, 而是token是否够便宜。以往的打法简单又粗暴, 堆砌最贵的模型一次次地扫, 成本始终居高不下。

微软打着的如意算盘是, 要让MAI – Cyber – 1 – Flash去承担吃掉九成任务的角色, 从而把最为昂贵的旗舰模型节省下来, 使其仅去应对那10%的难题。官方所展示的模型卡表明, 当把80%的模型调用替换为较为便宜的小模型之后, 成绩不但没有下降, 反而提升到了95.95%, 并且成本相较于此前最为优良的配置便宜了恰好一半。

系统才是真产品

95.那95%并非是MAI-Cyber-1-Flash这单一模型所取得的成绩, 而是由一套名为MDASH的涉及多模型的漏洞识别与修复系统运行得出的, 此系统之中有100多个专用智能体, 其中有的负责审查代码, 有的专门检验漏洞, 有的针对发现的真假情况进行相互辩论, 有的开展去重工作, 还有的撰写出漏洞证明。

微软着重指出, 竞争对手极难抄袭的数据, 是其每天能看到超100万亿个安全信号, 这些信号横跨身份、终端, 和网络, 云也包括在内。安全从响应中心到实战范围, 什么漏洞被拿来利用了, 什么被成功挡住了, 什么补, 丁真正发挥了作用, 全都掌握在微软手中。微软还放出一句狠话称: 这段历史没人能够凭空编造出来。

95.95%到底测什么

测得这个分数的, 是漏洞复现成功率, 而非漏洞发现准确率。基准由1507个真实漏洞构成, 这些漏洞来自188个开源项目, 智能体会依据漏洞描述以及补丁前代码生成PoC, 之后拿补丁前后的版本去验证复现。简单来讲, 是依照线索复现已知漏洞, 并非面对陌生代码盲目寻找新漏洞。

然而这个成绩得打个补丁, 那便是, 直至发稿时, 占据95.95%比例的部分尚未进入公开榜单 , 此时榜单上所展示的依然是微软5月那次的88.4%旧分数。可是MDASH在5月12日首次发布时的88.45%已然称得上是当时公开榜单上的最佳分数 , 此项成绩领先位居第二的比例多出约5个百分点 , 并且原始论文里当时最强组合的复现率仅有11.9%。

微软的野心与边界

当时MAI-Cyber-1-Flash并非为了成为被广传播供大众随取随用的模型, 它仅在MDASH内部, 借由Azure AI以私人预览的方式, 向那些经由审核合格的客户予以开放。微软构建起自身的安全模型, 其初衷是期望能减少对外部的依赖程度, 然而在实际推进进程中, 那最为艰难棘手的10%内容, 最终还是要交付给GPT-5.4来完成收尾工作。

在同一天的时候, 微软还抛出了更为庞大的事物, 那便是一个比MDASH体积更加庞大的智能体安全系统, 其中存在红队模拟攻击的情况, 还有蓝队进行检测分诊的情况, 另外绿队负责修复加固, 该系统于8月3日进入公开预览阶段, 然而关键动作,微软依旧坚持要把控在人手中。

存在一位安全研究者表明得极为透彻, 护城河正从模型访问朝着验证转变, 现今花费30美元运行一次公开模型也能够复现出某一级别的漏洞狩猎情况, 真正匮乏的是那一套既能够证实漏洞为真实、又不会将开发者淹没在误报堆中的系统, 往后比拼的并非是谁能够调用最为强大的模型, 而是谁能够把模型、数据、智能体、验证构建成一套持续运转且值得信赖的安全行动系统。

有没有觉着, 微软所采用一套办法, 是“小模型顶在下头前面位置、旗舰型的处于末端收尾”, 这样的打法, 会不会变成网络安全领域当中全新的标准构成配置? 欢迎来到评论区域, 来交流并且说一说你的观点, 如果你认为得到了启发, 那就点一个赞, 然后分享给同行。

相关文章