2026 年 8 月底,美、英、澳、加、新西兰五国安全机构联合发布了一份名为「Careful Adoption of Agentic AI Services」(谨慎采用 Agentic AI 服务)的公告,把采用智能体服务要应对的风险整理成 23 项、五大类,并把「密码学 Agent 身份 + 短生命周期凭证」列为基线要求。这不只是安全圈的事——如果你所在团队正在或准备上线 Agent,这份清单就是你的体检表。这篇教程带你逐类对照自查,并给出一份 30 天分批落地路线。
🛡️ 本教程适合:企业安全/运维负责人、Agent 项目的技术负责人,以及所有「正在给 Agent 开权限」的人。会画表格、会排优先级就能用。
Step 1:先读懂公告的来龙去脉
1 为什么五国安全机构要联合发声
背景时间线:
· 6 月:五眼联盟网络安全机构联合声明——
前沿模型正同时改写攻防能力,时间线是「几个月」
不是「几年」
· 8 月:多起 Agent 安全事故(如 Cursor 被黑事件)
推动各国把「Agent 安全」从讨论变成清单
· 8 月底:23 条风险清单正式发布
公告核心判断:
· 传统 IAM(身份与访问管理)框架
「不足以支撑 agent-to-agent 交互」
· 基线要求两条:
① 密码学 Agent 身份(每个 Agent 有独立身份)
② 短生命周期凭证(用完即失效,不是长期 API Key)
· 五大类 23 项风险,覆盖身份、权限、
执行环境、供应链、审计全链路
💡 别把它当「又一份安全报告」:这是五国安全机构的联合口径,未来云厂商、SaaS 平台大概率会把自家产品对照这 23 项做映射——提前自查 = 提前通过未来的安全问卷。
Step 2:23 项风险五大类——先建框架
2 五大类风险对应五张检查表
| 风险类别 | 典型问题 | 自查入口 |
|---|---|---|
| ① 身份与凭证 | Agent 用谁的 Key?泄露了谁负责? | Agent 身份体系 |
| ② 权限边界 | Agent 权限是否超过任务所需? | 最小权限 + 动态授权 |
| ③ 执行环境 | Agent 能访问网络/文件/内核吗? | 沙箱与隔离 |
| ④ 供应链 | 框架、插件、模型权重可信吗? | SBOM + 依赖审计 |
| ⑤ 审计与可观测 | 出了事查得到「谁在什么时候做了什么」吗? | 签名审计日志 |
23 项的具体清单以官方公告原文为准(关键词:Careful Adoption of Agentic AI Services);关键是先把五类框架搭起来,逐项对号入座——这正是《Anthropic CISO 四问法》「先问四个问题再谈落地」的延续。
Step 3:先做风险打分——三指标定优先级
3 数据敏感度 × 行动自主性 × 外部连接
参考 CISA 风险矩阵,对每个 Agent 打分(1-5):
A. 数据敏感度
· 1 = 公开信息 · 5 = PII/财务/病历
B. 行动自主性
· 1 = 纯问答 · 5 = 可改生产系统/汇款
C. 外部连接
· 1 = 完全内网 · 5 = 可访问公网 API/邮件
总分 ≥ 8(满分 15)→ 强制进入安全实施流程
触发重新评估的事件:
· Agent 出现非预期行为
· 新增工具/集成
· 模型版本更新
· 出现新攻击向量
打分样例:
· 客服问答 Bot(2+1+2=5)→ 低风险,常规管理
· 能操作生产数据库的运维 Agent(4+5+4=13)
→ 立即整改,先降权限再上线
别给 Agent 开「人级」权限:Agent 继承调用者的权限是当前最大的结构性风险——提示词被注入 = 凭证被偷。权限必须按任务最小化,而不是按「它像谁」来给。
Step 4:30 天落地路线——四个星期各干一件事
4 盘点 → 隔离 → 基线 → 人机协同
Week 1:资产盘点(Inventory)
· 列出生产/试点中的每个 Agent
· 揪出「影子 Agent」——员工在个人账号
里自建的 Agent 是最大事故源
· 每个 Agent 登记:模型、工具、权限、负责人
Week 2:身份与隔离(Identity & Sandbox)
· 每个 Agent 一个独立服务身份(service principal)
· 凭证改为 JIT(按需签发、短期有效)
· 沙箱默认禁止出网,按工具/目的地逐个放行
(能 clone GitHub 不代表能访问工资系统)
Week 3:行为基线(Behavioral Baselining)
· 记录正常行为模式(工具调用频率、访问目标)
· 接入审计日志,100% 记录工具调用与授权决定
· 建立异常检测(偏离基线即告警)
Week 4:人机协同(Human-in-the-loop)
· 高风险动作(不可逆操作)强制人工审批
· 月度红队演练:提示词注入、记忆投毒专项
· 季度轮换凭证并核验信任锚
三项低门槛高收益控制(68% 攻击面):
· JIT 凭证范围化(成本最低,降 73% 凭证暴露)
· Agent 间通信启用 mTLS
· 推理链路结构化审计日志
🚀 有零信任基础的组织 4-6 周可完成基本控制;没有的按 12-16 周全量推进。别追求一步到位,先让高风险 Agent 达标。
Step 5:SAFE 四件套——让每次行动都可解释
5 Sign · Attest · Fact-check · Explain
| 动作 | 含义 | 落地方式 |
|---|---|---|
| Sign 签名 | 每次行动有可验证身份 | 密码学 Agent 身份(基线要求①) |
| Attest 背书 | 行动可回溯到授权它的策略 | 策略 ID 写入执行记录 |
| Fact-check 核验 | 结论对照检索证据 | 引用来源可回查 |
| Explain 解释 | 不可逆动作前给出人可读说明 | 高风险操作前置审批说明 |
SAFE 不是产品,是一个周末就能用现有日志与策略引擎实现的清单。与《OpenAI 攻破 Hugging Face》复盘里「隔离环境 + 可审计决策日志」的建议互为印证——防御不是防模型变坏,是防系统扛不住会行动的模型。
Step 6:持续运营——安全是过程不是证书
6 月度红队 + 季度轮换 + 持续监控
持续运营节奏:
· 每月:Agent 专项红队
- 直接/间接提示词注入测试
- 记忆投毒测试(污染共享记忆库)
- 越权行动测试(Agent 是否被诱导超权限动作)
· 每季:凭证轮换 + 信任锚核验
- 所有 Agent 凭证换新
- 审计日志完整性抽查(防篡改验证)
· 持续:依赖与权重监控
- SBOM 随框架/依赖更新同步核验
- 模型权重更新后重新评估
- 34% 的事故来自「通过初审后被更新的
框架/权重带进漏洞」
· 事件后:任何非预期行为触发立即重新评估,
不等季度节点
一句话总结:Agent 安全没有「做完」,
只有「持续做」。23 条清单是起点,
不是终点。
🎉 行动建议:本周先做 Step 3 的打分(半天就够),把 ≥8 分的 Agent 列出来——那就是你 30 天路线图的第一批整改对象。