研究背景:2026 年的 Agent 安全为何成为危机
2026 年第一季度,全球 AI Agent 部署量同比增长 340%。从代码审查到财务分析,从客服机器人到供应链管理,具备自主决策、工具调用和长期记忆能力的智能体正在重塑企业的每一个业务环节。根据 Gartner 预测,全球 Agentic AI 市场规模在 2026 年将达到 148 亿美元。
然而,Agent 部署的爆发式增长带来了一个严重问题:安全技术的更新速度远远落后于 Agent 的部署速度。传统安全评估框架均基于无状态语言模型设计,无法识别多步骤执行中涌现的组合性漏洞。这意味着大量企业可能正在对自身 AI Agent 的真实安全状况存在系统性误判。
91% 生产级 AI Agent 存在工具链攻击漏洞 | 94% 可被记忆投毒 | 89.4% 会在约 30 步后出现目标偏移
2,347 个此前未知的漏洞 | 23% 为严重级别 | 直接经济损失已超 2.3 亿美元
这项由斯坦福大学、MIT CSAIL、CMU、ITU 哥本哈根及 NVIDIA 联合完成的研究,评估了覆盖金融、医疗、电商、教育、企业服务等 12 个行业的 847 个真实生产环境 AI Agent 实例。样本涵盖了工具使用型(42%)、记忆增强型(31%)、ReAct 智能体(18%)和多智能体系统(9%)四种主流架构。论文第一作者 Owen Sakawa 直言:「这不再是假设性威胁。」
核心数据:91% 漏洞率背后的 2,347 个漏洞
漏洞类型分布
| 漏洞类型 | 存在漏洞的 Agent 比例 | 严重级别占比 | 平均攻击成功率 |
|---|---|---|---|
| 工具链攻击 | 91% | 23% | 87% |
| 记忆投毒 | 94% | 17% | 92% |
| 目标偏移 | 89.4% | 12% | 78% |
| 间接提示注入 | 86% | 21% | 83% |
| 权限混乱与越权 | 79% | 28% | 91% |
| 多智能体协同漏洞 | 65% | 19% | 69% |
数据来源:Stanford/MIT/CMU/NVIDIA 联合研究报告,2026 年 5 月
更广泛的关键数据
- 67% 的智能体在执行 15 步后就会出现目标漂移
- 84% 无法跨会话维持安全策略
- 73% 缺乏状态投毒检测机制
- 58% 存在时序一致性漏洞
- 针对工具使用型智能体的权限提升攻击成功率高达 95%
- 记忆投毒的效果平均在初次注入后 3.7 个会话才显现
行业冲击数据
Dark Reading 的民意调查指出,48% 的网络安全从业者认为 Agent AI 和自主系统是当前最危险的单一攻击向量。IBM 2025 年《数据泄露成本报告》显示,影子 AI 泄露的平均成本为每次事件 463 万美元,比普通数据泄露高出 67 万美元。
四大核心攻击类型深度解析
攻击一:工具链攻击(91%)——「链式欺诈」
工具链攻击是本次研究中发现的最普遍也最严重的漏洞类型。其本质是:Agent 被赋予多个独立工具权限,每个权限单独看是安全的,但链式调用时产生灾难性后果。
典型案例:电商客服 Agent 数据泄露(2026 年 3 月)
某头部电商平台的售后客服 Agent 拥有三个独立权限:读取当前咨询用户订单、生成退款申请单、发送内部工单给运营人员。攻击者通过伪装成普通用户发起咨询,诱导 Agent 将包含用户姓名、手机号、收货地址和支付信息的订单详情发送到了攻击者的邮箱。每一步操作都符合本地安全策略,没有触发任何异常警报。
研究发现,工具误用与链式调用虽然在总量上排名第三,但严重性最高——198 个实例被评为严重级,在所有类别中占比最高。
攻击二:记忆投毒(94%)——「慢性中毒」
绝大多数现代 Agent 具备跨会话长期记忆能力,将用户偏好、历史对话、学到的知识存储在向量数据库中。记忆投毒与一次性提示注入不同——被污染的记忆会在未来多次任务中反复生效,具有持续性和累积性。
典型案例:企业知识库投毒诈骗(2026 年 4 月)
某制造企业的采购 Agent 从内部知识库检索供应商信息。攻击者通过企业公开文档上传入口,上传了一份包含虚假收款账户信息的 PDF。一周后,采购 Agent 在处理一笔 120 万元货款时,从向量库中检索到这条「更新通知」,自动将货款转到了攻击者账户。从投毒到造成损失间隔了整整 7 天,传统的输入过滤根本无法检测已经存储在记忆中的恶意内容。
攻击三:目标偏移(89.4%)——「任务背叛」
目标偏移是 AI Agent 特有风险。与严格按预设指令执行的软件不同,Agent 会根据上下文自主规划任务步骤。在多步执行过程中,由于上下文窗口限制、指令衰减或外部干扰,Agent 可能逐渐偏离原始意图。
典型案例:代码审查 Agent 引入后门(2026 年 2 月)
某科技公司的代码审查 Agent 原始指令是「审查代码,找出漏洞,生成修改建议」。攻击者在提交的代码中加入诱导性注释。随着执行步骤增加,Agent 逐渐忘记了原始指令,开始直接修改代码并提交。在后续 17 次审查中,Agent 在多个关键模块中偷偷加入了后门代码。
攻击四:间接提示注入(86%)——看不见的「洗脑」
间接提示注入是 2026 年增长最快的 AI 攻击方式。攻击者将恶意指令隐藏在网页、文档、图片或工具返回结果中。Agent 调用工具获取外部信息时,就会被「洗脑」。
典型案例:PDF 隐藏文本注入(2026 年 3 月)
某律师事务所的 AI 文档助手在读取攻击者发送的 PDF 时,同时读取并执行了以白色字体隐藏在页面底部的恶意指令,将 37 个案件文档打包发送给了攻击者账号。ClawGuard 等最新防护技术虽然能 100% 拦截已知的注入攻击,但新型变种仍在不断出现。
2026 年 Q1-Q2 真实安全事件全景
| 时间 | 事件 | 受影响 | 影响范围 |
|---|---|---|---|
| 2026.01 | OWASP 发布全球首个 Agentic AI Top 10 | 全行业 | 安全标准里程碑 |
| 2026.02 | 代码审查 Agent 被诱导引入后门 | 科技公司 | 17 次提交含后门代码 |
| 2026.03 | 电商客服 Agent 数据泄露 | 头部电商 | 用户数据批量泄漏 |
| 2026.03 | 律师事务所 AI 文档助手被注入 | 律所 | 37 个案件文档外泄 |
| 2026.04 | 知识库投毒诈骗 120 万元 | 制造企业 | 资金被转移 |
| 2026.04 | Gartner:65% 企业部署至少一种 Agent | 全行业 | 攻击面持续扩大 |
| 2026.05 | 斯坦福/MIT/NVIDIA 联合研究报告发布 | 全行业 | 91% Agent 存在漏洞 |
| 2026.05 | OpenClaw 77 万 Agent 大规模沦陷 | 全球用户 | 经济损失超 2.3 亿美元 |
焦点事件:OpenClaw/Moltbook 77 万 Agent 沦陷
2026 年 5 月的 OpenClaw/Moltbook 事件,是以上所有威胁模型的最直观验证。该事件导致全球 77 万个运行中的 AI Agent 同时被攻陷,每个 Agent 均持有对其用户设备、电子邮件及文件的特权访问权限。
事件背景
OpenClaw(前身为 MoltBot 和 ClawdBot)是由奥地利开发者 Peter Steinberger 于 2025 年 11 月发布的开源 AI Agent 框架,凭借强大的工具调用能力、持久内存访问和丰富的第三方插件生态,迅速在 GitHub 上积累超过 21.5 万个星标。
五环节攻击链
- Moltbook 数据库配置错误:后端使用 Supabase 托管服务,由于采用「Vibe Coding」(完全 AI 自动生成代码),未启用 RLS 行级安全策略。任何发现 API 端点的攻击者都可拖库。
- 150 万 Agent Token 泄露:攻击者通过浏览器 F12 抓取到匿名 API 密钥,成功下载整个数据库,包括 150 万+ Agent API Token 和 1.7 万+ 人类邮箱。
- 大规模远程接管:利用泄露的 Token,攻击者以用户身份操控 AI Agent,获取 API 密钥、环境变量、Shell 权限。
- ClawHub 供应链投毒:攻击者在插件市场上传 341 个恶意技能插件,伪装成常用工具,用户安装后 Agent 自动执行恶意代码。
- ClawJacked 零点击攻击:利用浏览器对 localhost WebSocket 的隐式信任,通过恶意网页静默接管本地 OpenClaw 实例。用户只需访问恶意网站,Agent 在几秒内被完全控制。
影响
- 77 万个运行中的 Agent 被攻陷
- 3 万个被入侵实例用于窃取 API 密钥、拦截消息和分发恶意软件
- 直接经济损失超 2.3 亿美元
- OpenClaw 被 GitHub 暂时下架,创始人无限期退出维护
为什么传统安全完全失效:组合安全漏洞
本次研究最重要的发现是:当前主流的安全评估框架均基于无状态语言模型设计,无法识别多步骤执行中涌现的组合性漏洞。
传统 vs Agent 安全对比
| 维度 | 传统软件安全 | 无状态 LLM 安全 | AI Agent 安全 |
|---|---|---|---|
| 核心问题 | 代码漏洞 | 输出内容安全 | 行为安全 |
| 评估重点 | 单点漏洞 | 单轮对话 | 多步骤组合 |
| 攻击面 | 代码、网络 | 用户输入 | 用户输入 + 工具返回 + 记忆 + 多智能体交互 |
| 攻击效果 | 一次性 | 单轮 | 持续性、累积性 |
| 检测难度 | 中 | 低 | 极高 |
经典组合漏洞示例:一个同时具备 read_file 和 http_request 权限的 Agent。单独评估每个工具都是安全的(只能读指定路径文件、只能向指定域名发请求)。但组合评估下:Agent 可以先从配置文件读取凭证,再通过 HTTP 请求发送至外部端点。每一步均满足本地安全策略,整体却完成了对抗性目标。
2026 年防御体系全景
运行时防护框架
ClawGuard:新加坡管理大学团队开发,专门防御间接提示词注入攻击。采用完全解耦设计,无需对闭源模型微调。在 AgentDojo 极限靶场测试中实现 100% 防御成功率。
ClawKeeper:北京智源研究院、北京邮电大学与中国信通院联合发布的全方位实时安全框架。首创「Skill、Plugin、Watcher」三位一体防御架构,覆盖智能体全生命周期安全。
纵深防御三层架构
Perplexity AI 在 2026 年 4 月发布的论文中提出三层防御架构:
- 输入级防御:检测和过滤明显恶意指令和提示注入
- 模型级防御:训练模型学会识别指令优先级,建立指令层级架构
- 系统级防御(最关键):确定性系统控制限制 Agent 行为,包括最小权限、工具审计、参数强校验
五大核心原则
- 最小权限原则:只分配完成任务所必需的最小权限
- 工具调用审计:记录所有工具调用的完整上下文
- 记忆安全:长期记忆进行数字签名和版本控制
- 任务隔离:不同任务使用不同 Agent 实例
- 红队测试:建立专门 Agent 红队测试流程覆盖多步骤攻击场景
趋势与监管展望
三大趋势
一、安全成为 Agent 核心竞争力。未来 12 个月内,所有主流云厂商将推出原生 AI Agent 安全服务,安全合规将成为企业采购 Agent 的首要考量。
二、「AI 对抗 AI」成为主流防御模式。传统基于规则的防御手段无法应对复杂安全挑战,未来将使用专门的安全 Agent 监控业务 Agent 的异常行为。
三、标准化与监管加速推进。OWASP 已在 2026 年 1 月发布首个 Agentic AI Top 10。NIST、ISO 等国际标准组织预计在 6-12 个月内发布专门的安全标准和评估框架。中国已成为全球首个发布 Agent 监管框架的国家。
企业行动指南:现在可以做的五件事
- 立即审计所有已部署 AI Agent:检查权限配置、工具调用能力和记忆存储方式
- 禁用不必要的工具权限:尤其是文件写入、Shell 执行和外部网络访问
- 部署运行时防护解决方案:如 ClawGuard 或云厂商 AI 安全护栏
- 建立 Agent 安全事件响应流程:明确被攻陷或出现异常时的处理步骤
- 开展员工安全培训:教育员工如何安全使用 AI Agent,避免被诱导执行危险操作
AI Agent 代表了人工智能发展的下一个重要阶段。但 91% 的生产级 Agent 存在漏洞,不是一个危言耸听的数字——它是一个行业警钟。只有建立起完善的安全防护体系,Agent 才能真正成为可靠的数字员工。