让 AI 读代码、找漏洞,已经不算新闻。真正的难点在于:模型给出的结论,凭什么让人相信?9 月 11 日,AI 安全能力评测基准 CyberGym 更新榜单,蚂蚁集团 AI 安全实验室研发的天工 Cyber 模型与天工 Harness,以 98.5% 的漏洞验证成功率登顶。这条消息的技术分量,不在那个百分比,而在它被评测的方式——这个榜单明确写着:让程序崩溃,不等于复现了目标漏洞。

先看榜单在考什么

据公开信息,CyberGym 由加州大学伯克利分校相关团队提出,是一个面向真实世界网络安全能力的大规模评测框架,在可复现的执行环境中评估 AI Agent 的漏洞分析能力,当前榜单收录 8 个模型结果。它的核心规则颇为严格:系统必须建立「异常现象」与「指定缺陷」之间的严密因果关系。也就是说,一个 Agent 即便让目标程序崩了,如果崩溃的原因不是它声称的那个漏洞,这次作答就不算通过。

这条规则把评测的难度从「生成」推到了「证明」。写出一段看似合理的漏洞分析并不难,难的是让它经得起证据检验:漏洞机理是否成立、触发路径是否排他、PoC 是否可重复、崩溃是否由目标缺陷引起。评测考的不是模型能否拼凑出貌似合理的答案,而是能否完成一场受证据约束的深度漏洞研究。

作为参照,CyberGym 模型榜上目前排在前列的包括 DeepSeek-V4.1-Flash(Max,带工具,88.1)、GLM-5.3(84.5)、GPT-5.6 Sol(84.5)、DeepSeek-V4-Pro(83.3)、Kimi K3(80.0)等。需要说明的是,模型榜与「模型加 Harness 系统」榜并非同一口径,前者的分数是模型在给定配置下的结果,后者则包含工具编排、环境复现与结果验证等系统能力,两者不宜直接横向比较。

天工 Harness:把多个模型编排成一个「验证流程」

据公开信息,天工 Harness 融合了自研的天工 Cyber 模型,以及 DeepSeek V4 Pro、Qwen 3.8 Max 等国产大模型的能力,可完成漏洞分析、PoC 构造与结果验证,覆盖复杂软件漏洞验证的端到端流程。换句话说,登顶的不是单一模型,而是一套「模型 + 工具 + 流程」的组合系统。

这个结构值得展开看。漏洞验证天然是一个多阶段任务:先理解代码与缺陷机理,再构造能触发缺陷的输入,最后确认崩溃确实由该缺陷引起。三个阶段对能力的要求不同——机理理解偏推理,PoC 构造偏代码生成与调试,结果验证偏严格判断。把不同模型分配到不同阶段,再用工具链把流程串起来,本质上是把「一个模型包办一切」换成「分工协作」。这与近期智能体工程的普遍趋势一致:能力上限越来越取决于编排,而不是单点模型强度。

一个可以互证的国内案例是深信服。据公开信息,深信服 Sangfor AI 依托国产基座模型 GLM-5.2,在 CyberGym 包含 1507 项真实漏洞任务的测试中完成 1301 项,综合成功率达 86.3%,其中 ARVO 来源任务完成 1193 项(成功率 87.2%)、OSS-Fuzz 来源任务完成 108 项(成功率 77.7%)。这个案例同样强调,被验证的不只是模型对代码的阅读理解能力,而是一个安全 Agent 系统能否把分散的代码推理与工具调用,整合成可探索、可追溯、可验证、可交付的流程。

为什么「Harness 工程」成了分水岭

据公开信息,蚂蚁数科在 AICon 全球人工智能开发与应用大会上分享过一组 Harness 工程实践:在一个 40 多万行的 Rust 新项目中,团队从项目初期就把约束与验证内建进研发流程;在一个超过 60 万行的 C++ 存量项目中,先重建事实源与质量门禁,再让 Agent 参与仓库升级,改造后代码缺陷率从 20% 以上降至个位数。这套实践的结论是:AI Coding 并没有创造全新的软件工程问题,而是以更高的产能,把需求模糊、目标漂移、事实冲突与验证不足等旧问题集中放大。

把这个判断放到漏洞验证场景里,逻辑是相通的。安全 Agent 的价值不在于「找得多」,而在于「说得准」。如果验证环节不严格,Agent 会批量产出看似合理、实则无法复现的结论,反而增加人工核验负担。这也是 CyberGym 那条规则的意义所在——它用评测口径强制把「证明」纳入能力定义,逼迫系统在流程层面把验证做实。

中立思辨

需要理性看待这份榜单成绩。其一,模型榜与系统榜口径不同,98.5% 与模型榜上的 88.1、84.5 等数字不可直接比较,脱离评测定义讨论分数高低意义有限,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。其二,98.5% 是特定评测集与特定时点下的成绩,评测集来源(如 ARVO、OSS-Fuzz)以开源项目为主,对商业闭源软件、特定行业系统的覆盖有限,不能简单外推为「通用漏洞发现能力」。其三,任务难度分布未公开时,高成功率可能部分来自任务构成而非能力跃升,需要对照榜单细则与任务清单判断。其四,安全能力的自动化是一把双刃剑:同一种「自动验证漏洞」的能力,若被用于非授权场景,可能带来新的风险,这类能力的开放程度与合规边界需要行业共同约束。其五,把多个国产模型编排进一个 Harness 系统,短期提升了成绩,长期也带来维护成本——上游模型每次迭代都可能改变系统行为,需要持续的回归与校准。其六,「登顶」是时点成绩,榜单会随新提交持续变化,不宜作为长期结论。其七,从安全能力评测到生产环境的安全运营,中间还隔着误报率、响应时效、与既有安全流程的集成等大量工程问题。

趋势研判

短期,安全 Agent 的竞争焦点会从「能不能找漏洞」转向「能不能证明漏洞」,验证闭环的严谨度会成为核心指标;中期,围绕 Harness 的工程能力会进一步分层——编排、环境复现、结果校验将各自形成可复用的组件,模型选择反而趋于灵活;长期,安全 Agent 可能成为软件交付流程里的常规环节,与代码审查、依赖扫描、质量门禁并列。对整个行业而言,这条路径的成熟,意味着「AI 会写代码」之后的下一道必答题——「AI 的判断如何被信任」——正在被认真作答。