智能体的安全,正在从「模型会不会被越狱」升级到「装进来的插件会不会下毒」。7 月 20 日,UIUC、UC Berkeley 等高校团队发布 SafeClawArena 评测框架,在 3 个平台、5 个主流大模型上测试一类「Claw 类智能体」(即带有技能/插件市场、可自主调用第三方能力的智能体)的安全表现。结果触目:恶意插件在未加固的智能体上百发百中,攻击成功率最高达 70%,并暴露出技能供应链、持久状态等四类攻击面。当智能体开始像手机一样装「App」,它的应用商店,也就成了黑客的新猎场。
一、SafeClawArena:把「技能市场」当成攻击面来测
过去两年,Agent 安全研究的目光主要锁在模型本身——越狱、提示词注入、对齐失效。但 SafeClawArena 换了一个视角:它盯上的是智能体生态里的「第三方技能」。这类 Claw 类智能体(如 OpenClaw 及其技能生态 ClawHub)允许用户安装社区或厂商提供的插件来扩展能力,本质上与手机安装 App 无异。问题在于,插件拥有在智能体运行时执行代码、读写状态、调用工具的权限,一旦来源不可信,便等于在 Agent 体内埋下后门。SafeClawArena 把这种「装了恶意插件后会发生什么」做成可复现的评测,首次系统性地量化了技能供应链的风险敞口。
二、四类攻击面:技能供应链与持久状态最危险
报告点名了至少两类高危攻击面:其一是技能供应链——恶意或遭投毒的插件经市场分发后,被毫无防备地安装到海量智能体上,攻击随生态扩张而规模化;其二是持久状态——恶意插件可在智能体的长期记忆或环境状态里留下痕迹,即便单次对话结束、甚至插件被移除,后门仍可能借持久状态复活。报告共指出四类攻击面,其余两类行业暂未披露细节。测试数据更直观:在未做任何加固的智能体上,恶意插件攻击成功率最高达到 70%,意味着十次里有七次能得手。这与此前披露的 HalluSquatting(利用模型幻觉抢注仓库名植入恶意码)形成呼应——攻击者的目标,正从「骗模型说错话」转向「借 Agent 之手干坏事」。
三、从「模型防越狱」到「运行时防插件」的安全范式迁移
SafeClawArena 的出现,标志 Agent 安全范式的一次关键迁移。当智能体只是个聊天框,安全重心在输入与输出;当智能体开始自主调用工具、安装插件、操作真实系统,安全重心就必须下沉到运行时——谁能装、装了能做什么、做完留了什么。这与今年早些时候 JADEPUFFER(AI Agent 自主完成勒索攻击全链条)、清华《智能体安全研究报告》(提出身份、策略、工具、日志四要素与七层控制框架)共同构成了一条清晰脉络:现象暴露问题、量化揭示规模、框架给出解法。SafeClawArena 补齐的,正是「技能供应链」这一此前被忽视的关键一环。
四、客观看:生态越繁荣,供应链越成软肋
70% 这个数字当然刺眼,但客观看,它测的是「未加固」基线,目的是暴露风险而非宣判死刑。真正的解法已经浮现:对插件做来源签名与权限沙箱、对持久状态做隔离与可审计、对工具调用做最小权限与实时拦截。挑战在于,安全加固 inevitably 会增加生态的摩擦——过度审查会劝退开发者,过度宽松又会重演 70% 的悲剧。这恰是每一个 Agent 平台都要回答的治理题:如何在「开放生态」与「可信执行」之间找到平衡点。可以预见,随着 Claw 类智能体的技能市场走向繁荣,供应链安全将从论文里的四个攻击面,变成产品里必须内置的一层护栏。