一个更新节奏很密的开源项目

安全工具的成熟度,有时可以先看版本节奏。腾讯朱雀实验室开源的 AI 红队平台 AI-Infra-Guard,7 月发布 v4.5.0,8 月连续推出 v4.5.2 与 v4.6.0,9 月 10 日又更新到 v4.6.1。三个月的密集迭代,说明团队在持续跟进最新的攻击手法,而不是发完一版就搁置。

它之所以值得单独写,是因为它把「给智能体做安全体检」这件事拆成了一套可操作的清单,而不是停留在原则层面。对正在把 Agent 推进生产的团队来说,这类工具的价值在于把抽象风险变成可勾选的项目。

五个攻击面加一项附加能力

平台的能力结构大致可以分成五块,另加一项辅助功能。

其中一块是 Agent 扫描,定位为多智能体自动化扫描框架,用来评估 Agent 工作流本身的安全性,官方称支持 Dify、Coze 等平台上搭建的 Agent。这一块针对的是「编排层」的风险,而不只是单点模型。

第二块是 Skill 与 MCP 扫描,覆盖十四大类安全风险,支持从源代码或远程 URL 两种方式扫描,且不需要把实例跑起来。这一点在工程上很关键:很多团队希望在合并代码或接入第三方工具之前就完成检查,而不是等到部署之后。

第三块是 AI 基础设施扫描,做的是组件指纹识别,官方称覆盖 146 个 AI 组件、关联 2000 多个已知漏洞,名单里包括推理服务、编排工具与可视化前端等常见组件。

第四块是越狱评测,包含多轮越狱攻击手法,并支持跨模型的横向对比。第五块是针对特定开源智能体生态的一键配置检查,评估不安全配置、技能风险、已知漏洞与隐私泄露等问题。此外还有一项附加能力,做模型指纹识别、签名校验与中转服务的黑盒审计。

把这五块连起来看,它覆盖的是一条完整的链路:从底层组件有没有已知漏洞,到 Agent 编排是否安全,再到具体的技能与工具是否被投毒,最后到模型本身能否被绕过。这是一种纵深防御的检查思路。

把 Skill 风险拆成九类,是这份清单里最有用的部分

平台把 Skill 的风险分成五层、九类,编号从 T01 到 T09,分别是:指令劫持、记忆投毒、远程载荷下载执行、内嵌恶意代码、提权与越权、系统持久化、工具劫持与仿冒、不安全依赖、不安全编码实践。

这份分类的价值,在于它把「装了一个技能会不会出事」这个模糊问题,翻译成了九个具体问题。其中几类尤其值得留意。

指令劫持与工具仿冒,针对的是技能文件本身携带的指令可能覆盖或篡改 Agent 的原始目标;记忆投毒针对的是技能往长期记忆里写入污染内容,从而影响后续所有会话;远程载荷下载执行与系统持久化,则把技能从「文本文件」拉回到「可执行代码」的现实——一个 Markdown 文件里如果包含下载并执行远程脚本的指令,它的破坏力不亚于一段恶意程序。

提权与越权这一类的分量也在上升。当技能可以声明自己需要哪些工具权限时,声明的范围与实际需要之间往往存在落差,而很多平台的默认策略并不强制收敛。把这一类单独列出来,等于提醒团队:技能不是越能干越好,权限要跟着任务走。

对没有自建安全团队的团队,这九类基本可以直接当一份技能准入检查表使用。

扫描器本身也要被评估

平台附带了一个技能扫描的评测榜单,公布了几款模型在该任务上的表现:其中一款在精确率与召回率上都接近 0.99,误报率约 0.07;另一款召回率更高,但误报率明显上升;还有一款误报率压得很低,代价是召回略降。

这组数字背后有一个容易被忽略的判断:扫描器本身也需要被评估。安全工具如果误报太多,团队会逐渐忽略告警;如果漏报太多,则会形成虚假的安全感。误报率能不能压到足够低,是这类工具能否进入持续集成流水线的关键。官方公布的榜单同样属于自评,样本构成与判分口径未展开,因此更适合当作方向性参考,而不是可直接引用的基准。

它管不到的几件事

需要明确边界。

其一,扫描通过不等于运行时安全。静态扫描能在合并前发现问题,但 Agent 的风险很大一部分来自运行时的工具调用序列与外部输入,这类风险需要在网关或运行时策略层处理。

其二,特定生态的检查项只覆盖那一个生态。如果团队用的是自研框架,这部分能力无法直接迁移,需要自己补上对应规则。

其三,技能来源与版本漂移仍需单独治理。一个今天扫描通过的技能,明天更新之后是否仍然安全,取决于团队有没有把来源、版本与更新审批纳入流程。扫描是一次性动作,治理是持续动作。

其四,越狱评测的结论会随模型迭代快速过期。这类评测更适合作为回归测试定期重跑,而不是一次性的合规证据。

把 Agent 安全做扎实,最终仍要落到三件事上:身份是否独立、权限是否随任务收敛、每一次动作是否可追溯。扫描工具能覆盖其中相当一部分,但它替代不了权限模型本身。

该平台各攻击面的检出率口径、误报样本构成与许可条款细节,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。