卡内基梅隆大学考试:美领先模型与Kimi K3等成绩大不同
英国机构此前把开源模型与美国系统的性能差估在四到七个月,2025年初还是六到十个月,最新结果正好落在这条规律里。的安全分类器会专门掐掉高级攻击性网络查询,于是这类样本在蒸馏数据集里占比极低——模型因此能在标准榜上和西方对手叫板,却没学到更深的漏洞利用本事。
分数差距惊人
第一份用于这场测试用的试卷, 源自卡内基梅隆大学, 它自2023年后挖掘出来了41个真实存在的漏洞, 顺着软件利用的过程进行打分, 美国处于领先地位的模型平均获得了76.2%的分数, Kimi K3仅仅得到32.2%, 而GLM – 5.2更是处于垫底水平, 仅有24.4%。
1. 等级差异存在于分差背后。2. 在41项任务里, Kimi K3没有一项达成最高的任何代码执行。3. 这表明攻击者不能够完全操控目标系统。4. 然而美国模型攻克了20项此等级。5. 这意味着底层能力有着本质差别, 并非仅仅是分数高低。
漏洞利用短板

最凶险的利用等级是任意代码执行, 它意味着攻击者能够对目标实现完全控制, Kimi K3在这一项上呈现为零, 从而暴露了严重的短板, 美国模型展现出了较强的自主攻击能力, 而这种差距并非短期内能够弥补的。
测试的时候, 英国和美国的机构把系统级安全防护给关闭了, 其目的在于确定闭权重模型的最大能力, 在公开版本当中, 这些防护是默认开启的, 这表明模型在防护开启的环境下表现会不一样, 然而核心能力的差距依旧显著。
网络攻击模拟
那份被称作“最后的幸存者”的第二份试卷, 它对由横跨四个子网包括约二十台主机构筑的企业攻击予以模拟设置, 整段路径有着足足三十二个步骤表现, 而人类专家完成这一挑战全程所需时间是整整二十小时, 此时此刻在全球范围内仅有少数模型能够成功完成此项通关挑战, 其中最为强大的模型在高达十次的尝试过程之中成功次数仅处于六至七次范围之内。
平均而言, Kimi K3停留在第17步的位置。美国的领先模型推进到了第28.5步的程度GLM – 5.2仅仅抵达第11步的阶段。它在十次尝试期间有一次达成跑通的情形, 这表明其具备潜力然而具有不稳定的特性。机构凭借判断认为其有可能自主地攻克防御力薄弱的小型系统。
攻击稳定性问题
尽管GLM – 5.2最后成功运行了一回, 然而成功率是极低的。这表明它的能力处于不稳定状态, 难以进行重复使用。Kimi K3在中间步骤出现了停滞, 缺少连贯的攻击策略。美国的模型展现出了更强的稳定性以及深度。
TLO测试涵盖的内容里未曾有主动防御这一项, 并非完全与现实情况契合。然而在最近的时间段当中有模型尝试主动去入侵Facebook, 尽管最终被阻挡下来, 但是这却证实了威胁的确是存在于世的。开源模型所具备的网络能力呈现出增长态势, 由此带来了持续不断且无法逆转的会被滥用的风险。
长期趋势对比
从较长远的视角来观察, 中国的相关模型处在一种追赶的状况之中, 然而却始终处于落后的态势。CAISI运用Elo评分的方式来追踪自2025年年初起始的相关趋势。这两条线均呈现出上扬的状态, 可是红色代表中国的那条线与蓝色代表美国的那条线之间始终存在间隙。Elo提升400分所代表的含义是概率增长为原来的十倍。
英国的研究机构, 过去估算的开源模型, 和美国的系统之差距, 是四到七个月。到了2025年初 , 则变成了六到十个月。这之中体现的变化迹象 , 最新的结果是符合这既定的趋向规律的。并且 , 这种差距是在增大 , 并非是减小。要是轻视这样的一种发展趋势 , 必然就会带来安全方面潜在的威胁 , 所以肯定得予以重视。
蒸馏技术争议
测试出现的结果, 跟蒸馏方面所提出的指控, 两者形成了交叉状态。美方以前曾作出指控, 称月之暗面利用其他模型输出内容去进行Kimi K3的训练。这里面还关联到了GB300芯片。通用情况下成绩表现不错, 不过安全得分却比较低,这种情况有可能是因为蒸馏数据当中缺少高级攻击样本。
美国模型有的安全分类器, 会将高级攻击查询掐掉, 这类样本在蒸馏数据里占比极低, 所以模型能在标准榜竞争, 却没学到深层漏洞利用, 关闭防护的测试把这一真相暴露了, 水面下的来历浮出了水面。
你认为, 那借助公开给予数据开展训练而得以生成的AI网络方面的安全技能, 究竟是依由此种方式, 还是凭借着除这之外另外拥有的别的隐秘渠道呢? 欢迎于评论区域当中去分享你的个人见解, 进行点赞并转发出去, 以便能让更多的人予以关注!