8 月下旬,老牌测试厂商 Tricentis 把目光从「被测软件」移向了「测试的智能体」本身,一口气发布围绕 Agentic 软件开发的系列创新。其中最值得玩味的,是一个叫 Aida 的自主智能体——它不需要预置测试套件与脚本,就敢自己摸索 web 与 Windows 桌面应用、把缺陷和覆盖盲区翻出来;配套推出的 AgentScore,则尝试给 Agent 的行为打分。当企业开始让编码与 QA Agent 上岗,测试的对象,正从一行行代码,变成「会自己干活的智能体」。
一、Aida:不需要脚本的「探索型」测试员
传统自动化测试的第一步,是人工写好脚本:点哪、填什么、期待什么结果。Aida 的做法相反——它自主探索应用,在 web 和 Windows 桌面环境里自行尝试路径、触发状态、观察反馈,从而暴露人类没写进用例的缺陷与覆盖盲区。价值在于:测试不再受限于「人先想到」的用例集,而是让智能体去撞那些边界情况。对测试资产薄弱、却又要快速迭代的团队,这条路降低了进入门槛。
二、AgentScore:给 Agent 的「行为」打分
更难的是第二步——怎么评价一个 Agent 好不好。AgentScore 的思路是按 Agent 在真实工作流中的实际行为,做概率性评估,而非只看它在静态基准上的分数。区别在于:基准看的是「会不会做某道题」,AgentScore 看的是「在真实业务流里稳不稳、偏不偏」。这恰好戳中了行业痛点:很多 Agent 在演示里满分,一进生产就静默出错。把评估拉回真实行为,才是 QA 该有的样子。
当 Agent 成为「被测对象」,QA 的范式被悄然改写:评估单位从「代码是否通过」变成「智能体是否可靠」。谁能把可靠性量化,谁就握住了 Agent 规模化的信任钥匙。
三、Release Risk Intelligence:把风险前置到发布前
第三块拼图是 Release Risk Intelligence,它在发布层面提示覆盖缺口,并给出降低风险的建议动作。换言之,它不是在事后告诉你「哪里挂了」,而是在发布之前就标出「哪里没被测到、风险有多大」。这与近期大厂「给 Agent 装质检线」的思路同频——把执行轨迹转化为测试样本与回归集,从源头压住「系统没报错但事办错」的新型故障。
四、背后的行业拐点
这套动作的底层逻辑是:企业一旦用上编码与 QA Agent,关注点就会从「模型能不能编译」转移到「Agent 在真实流程里靠不靠谱、会不会静默失败、会不会误删误发」。测试对象从代码扩展到智能体,意味着质量保障这门生意,正在被重新定义。它也与近期行业内「把 Agent 运行轨迹拿来做评测与可观测性」的趋势相呼应,只是 Tricentis 把它产品化、指标化了。
五、要清醒看待的边界
- 概率性评分仍需人类校准:AgentScore 给的是「可信度」而非「保证」,高分离不开真实场景的持续修正,避免「分数高=安全」的错觉。
- 探索型测试的盲区:自主探索再聪明,也看不全业务意图,关键合规路径仍要人工用例兜底。
- 生态尚早:用 Agent 测 Agent 仍处早期,标准与互认远未成形,厂商口径差异大。
把 Agent 当成测试对象,是一次意味深长的角色反转:过去我们让 AI 帮人写代码,现在开始让 AI 帮人盯住 AI。当「测 Agent 的 Agent」成为一条独立赛道,说明智能体行业真正开始认真对待「可靠性」这三个字——而可靠性,恰恰是规模化落地最难、也最值钱的那一关。