智能体Claw像台电脑,技能插件藏安全漏洞,用户小心
其网关同时挂着大模型内核、技能加载器、插件加载器、记忆、工具执行器和配置六个部件,每个部件都带着各自的安全隐患。技能与插件一经加载便继承了智能体的全部权限(违反最小权限);恶意插件在所有未加固的平台上都是100%得手,且不挑模型,因为它绕开了模型本身。
智能体像电脑一样脆弱
当下的AI智能体架构繁杂, 其网关之中充斥着大模型、插件以及记忆模块, 这恰似一台未装设杀毒软件的电脑, 各个部件皆潜藏着安全隐患, 一旦某个环节出现差错, 整个系统便有可能崩溃或者遭受攻击。
借用传统安全防护思路
业界欠缺针对这类智能体的系统性检测标准, 研究人员借鉴了操作系统几十年的防护经验, 像进程隔离和最小权限原则 , 他们把智能体的各个组件映射到系统安全的经典概念上, 进而找出缺失的防护环节。
四大攻击面暴露风险
存在这样一种情况, 研究团队从中提炼出五个核心安全原则, 进而发现智能体几乎在各个方面都失守了, 这一状况致使出现了四大攻击面, 它们分别是技能供应链、持久状态利用、跨边界数据流以及间接提示注入, 而这些漏洞使得恶意代码能够较为轻易地绕过模型, 此结果直接造成了操控底层服务现象的发生。
仿真环境精准测漏洞
团队搭建了仿真平台, 为的是能准确评估风险, 还植入了带有暗号的“金丝雀”凭证, 借助模拟真实对话以及任务分发, 来检测数据有没有泄露, 这种确定性比对方法比让 AI 当裁判更具可靠性, 可精准捕捉各类输出通道的异常数据。
模型对齐并非万能解
测评得出的结果表明, 那种具有恶意性质的插件, 在未加以稳固的平台之上, 其成功的概率竟然高达整整百分之百。虽说模型进行对齐是具备一定作用的, 然而它并不能够去取代架构层面的安全设计。有一些模型, 由于表现得太过顺从听话了, 这样子反而会更加容易去执行那些带有恶意的指令。仅仅是单一地对模型进行升级, 是没有办法消解根本性的架构方面的缺陷的。
纵深防御才是出路
不能仅依靠更换模型或者更改平台来保障智能体安全, 而必须要走纵深防御路线 , 如同操作系统那样去结合内存保护、代码签名等多重机制 , 当前技能签名以及凭证保险箱等关键防御普遍处于缺失状态, 补齐这些短板乃未来安全工作的重点方向。
你觉得你的AI助手能守住隐私底线吗?欢迎留言讨论!