2026 年 8 月 6 日,天融信发布AI 智能体安全评估服务:基于九维评估框架 + 39 项检查项,并为 OpenClaw、Hermes Agent、WorkBuddy 三大主流智能体提供专项检测。消息本身是安全厂商的新闻,但对所有在用 Agent 的团队来说,更值钱的是它把「Agent 安全到底要查什么」这回事结构化了——你完全可以照它的思路,给自己家的 Agent 先做一遍体检,而不是等出了事再补。
先搞懂:为什么 Agent 需要「体检」而不是「杀毒」?
传统软件安全是「防外敌」:装防火墙、杀毒、补漏洞。Agent 的威胁模型多了一层——它自带工具、自会行动,很多风险来自它自己:提示词注入、越权调用工具、记忆泄露、技能供应链投毒……所以需要的是覆盖「全生命周期」的体检式评估,而不是单一防线。
| 维度 | 传统软件 | AI 智能体 |
|---|---|---|
| 主要风险 | 漏洞被外部利用 | 权限越界 + 指令操纵 + 数据外泄 |
| 攻击面 | 网络端口、代码漏洞 | 提示词、工具调用、记忆库、技能包 |
| 防护思路 | 隔离 + 补丁 | 最小权限 + 全程审计 + 注入防护 |
前车之鉴:2026 年 7 月曝光的 JADEPUFFER 勒索 Agent 与 HalluSquatting 投毒事件,正是钻了「权限过大 + 技能来源不可信」的空子。体检的目的,就是把这类洞在出事前补上。
Step 1:认识九维框架——体检表分九大科
九维评估框架相当于把 Agent 拆成九个剖面逐项打分,每一维下挂若干检查项,合计 39 项:
| # | 维度 | 一句话理解 | 典型检查点 |
|---|---|---|---|
| 1 | 身份与鉴权 | 谁在指挥它 | 账号口令、MFA、会话失效 |
| 2 | 记忆与数据隔离 | 它记的东西谁能看 | 记忆分区、敏感信息脱敏 |
| 3 | 工具与权限 | 它能动什么 | 最小权限、危险工具白名单 |
| 4 | 指令与注入防护 | 有没有被话术操纵 | prompt injection 测试、指令优先级 |
| 5 | 技能与供应链 | 它用的技能可不可信 | 技能来源校验、依赖审计 |
| 6 | 日志与审计 | 它干了什么都留痕 | 工具调用日志、操作回放 |
| 7 | 输出与合规 | 它说的合不合法 | 内容合规、敏感输出拦截 |
| 8 | 网络与通信 | 它连了哪些外网 | 外联域名白名单、传输加密 |
| 9 | 应急与恢复 | 出事后怎么办 | 熔断开关、回滚预案、备份 |
Step 2:把 39 项分三档——别想一口吃成胖子
39 项全部精查工作量大,建议按风险影响分级:
第一档 · 上线必查(约 15 项,1 小时):
- 身份:账号是否强制 MFA、默认口令是否改掉
- 权限:工具是否最小授权、是否有删除/支付类高危工具
- 注入:跑 5 个标准 prompt injection 测试用例
- 技能:外部技能包是否校验来源与哈希
- 日志:工具调用是否留痕、能否回放
- 网络:外联域名是否有白名单
第二档 · 每周抽查(约 14 项,30 分钟):
- 记忆:记忆库是否包含不该存的信息
- 输出:最近 100 条回复里有无越权/敏感内容
- 会话:失效会话是否及时回收
第三档 · 月度可缓(约 10 项,60 分钟):
- 供应链:依赖库更新与 CVE 核查
- 应急:熔断演练、备份恢复演练
- 合规:涉密数据处理流程复查
Step 3:三大主流智能体专项检查示例
天融信为三大主流智能体做专项检测,核心差异在于它们的能力侧重。对应到自查:
| 智能体 | 重点查什么 | 自查动作 |
|---|---|---|
| OpenClaw | 技能来源 + 工具权限 | 技能白名单、skill 包哈希校验、工具最小授权 |
| Hermes Agent | 命令审批 + 沙箱 | 高危命令是否强制审批、本地执行是否走沙箱 |
| WorkBuddy | Skill 来源 + 自动化触发 | Skill 安装来源审计、定时任务触发条件复查 |
Step 4:把体检做成流程,而不是一次性动作
上线前体检(每次新 Agent 上线 / 大版本升级):
- 必查档 15 项全过
- 高危项(删除/付款/外联)有明确 owner
周期复检(每季度一次):
- 抽查档 14 项 + 必查档回扫
- 对比上季度得分,看趋势
变更后重检(每次加技能 / 加权限 / 接新 MCP 后):
- 新增面专项检查(新技能的来源、新权限的最小化)
- 变更前后行为对比
体检结果建议用一张打分表归档:
每维度 0~10 分,总分 90,低于 60 分暂停新功能上线。
最容易踩的坑:「上线前查一次就完事」。Agent 的权限和技能会不断变化,权限漂移是常态——所以季度复检必须纳入排期,哪怕只是过一遍必查档。
Step 5:输出一份可归档的体检报告
【Agent 安全体检报告】
一、对象:OpenClaw vX(技能 5 个 / MCP 3 个 / 用户 12 人)
二、评估框架:九维 × 39 项(本批次覆盖:必查 15 项)
三、体检时间:2026-08-08 体检人:运维组
四、九维得分:
1 身份鉴权 9/10 (问题:1 个管理员账号未开 MFA)
2 记忆隔离 8/10 (问题:共享记忆含 2 条客户手机号)
3 工具权限 7/10 (问题:删除工具全员可用,应收敛)
4 注入防护 9/10 (5/5 用例通过)
5 供应链 8/10 (1 个技能包无哈希校验)
6 日志审计 9/10
7 输出合规 9/10
8 网络通信 8/10 (白名单外发现 2 个外联域名)
9 应急恢复 7/10 (熔断开关未演练)
合计:74 / 90
五、整改项(按优先级):
P0(本周):删除工具改为管理员专用
P1(两周):记忆库清理敏感信息 + 敏感字段脱敏
P2(一月):外联域名白名单收紧 + 熔断演练
六、结论:通过(P0 项整改完成后复核)
Step 6:没有专职安全团队,怎么低成本起步?
如果你们团队只有两三个人,别想着一步到位,先跑「最小体检」:
最小体检 = 5 个动作(约 1 小时):
1. 权限收敛:把高危工具(删除/支付/外发)改成审批制
2. 注入测试:把 5 个标准注入用例跑一遍(可问 AI 要用例)
3. 来源审计:外部技能/插件全部登记来源 + 哈希
4. 日志开启:确保工具调用有日志、可回放
5. 熔断开关:确认一键停用 Agent 的按钮真实可用
做完这 5 件事,你的 Agent 就进入了「可评估、可审计、
可熔断」状态——比 90% 的团队都稳。
记住:安全是过程不是结果。工具会变、技能会加、权限会漂移——把体检排进日历,比任何一次性的大检查都重要。想了解威胁具体长什么样,可回看本站《Agent 安全加固与 JADEPUFFER 威胁解剖》。
常见问题速查
| 你遇到的现象 | 大概率原因 & 解决 |
|---|---|
| 39 项太多,做不过来 | 先做必查档 15 项,分级推进 |
| 没专职安全人员 | 用「最小体检」5 动作起步,见 Step 6 |
| 体检完没人整改 | 报告里每项带 owner + deadline,P0 项设截止 |
| 不知道该测哪些注入用例 | 让 Agent 自己生成 5 个标准用例,再人工审核 |
| 需要第三方正式评估 | 可联系天融信等厂商做专项检测(覆盖三大主流智能体) |