当 Agent 开始进 CRM、工单、支付、代码库和内部系统,替人跑一段段真实流程,「它会不会做」只是第一问,更难的那一问是:「它做完这件事,到底算不算做对?」8 月中旬以来,一个看似不起眼却方向一致的动作在大厂之间同步发生——Google、微软、Grafana 都在给 Agent 补上「质检线」:评测(Eval)与可观测性(Observability)。它们的共同判断是:Agent 真正开始干正事后,可靠性问题的核心不再是模型会不会「胡说八道」,而是另一种更安静的失败——系统没报错,事却办错了。

一、「系统没报错,事仍可能办错」:Agent 可靠性的新难题

传统软件出问题通常有迹可循:接口报错、服务超时、数据库连不上——运维系统盯住日志、指标和调用链,至少能回答「哪里坏了」。Agent 不一样:它可以在所有技术指标都正常时,把业务办错。一个差旅 Agent 接到指令订机票,它查到了航班、调用订票接口返回 200、最后在聊天框里写下「已完成预订」——从传统监控看,这次任务很健康,但用户想要的票可能根本不在预订列表里。更常见的失败形态包括:替销售更新 CRM 时把字段写到了另一个客户身上;说退款已处理、实际上只完成了查询;说代码修好了、测试过了,但线上权限被一并改坏了。更麻烦的是,Agent 行为是概率性的:今天的版本没问题,下周换一个模型、改一句系统提示词、接入一个新工具,行为就可能慢慢走样——这要求质量保障从「上线前的一次性测试」变成「上线后的持续监控」。

二、大厂质检线的三个样本:平台、轨迹与遥测信号

三个样本可以勾勒出这轮质检线的整体轮廓。其一是谷歌:4 月发布 Gemini Enterprise Agent Platform,把模拟、评测和可观测性放进了 Agent 的「优化」层,让企业可以在上线前模拟运行、上线后持续评估。其二是微软:5 月的 Microsoft Build 上,Foundry 展示了多轮评测、生产轨迹抽样、轨迹回放,以及「由生产轨迹生成测试集」的能力——微软的表述很准确:轨迹回答「发生了什么」,评测判断「好不好」,优化决定「下一步改哪里」。其三是 Grafana:7 月把 Agent Observability 推进到通用可用,并把 agent session(智能体会话)称作继指标、日志、链路追踪、性能剖面之后的第五类遥测信号——它把每一次 Agent 执行的完整轨迹当成一类一等公民数据来记录与分析。三者出身不同(谷歌做云上 Agent 平台、微软收进 Foundry、Grafana 来自传统可观测性世界),却都在补同一件事:让 Agent 的每一次「干活过程」变得可见、可评、可复盘。

三、从轨迹到测试集:一条完整的质检链路

这轮产品更新的核心,是试图把一条链路接起来:真实执行 → 留下轨迹 → 找到失败 → 归类原因 → 变成测试样本 → 修改系统 → 回归验证 → 小流量上线 → 继续观察。其中最具代表性的思路是微软提出的「把生产轨迹转成评测数据集」——过去的测试集大多由团队在会议室里设计,但真实用户的表达方式很杂,权限和工具一叠加,边缘情况往往比产品经理预先想象的多得多;生产环境里出现过的失败,反而是最值得留下来的题目:客户连续三次要求转人工、Agent 仍在安慰解释;某类历史订单一查就让工具参数错位;合规审查在长对话之后悄悄丢掉关键限制……这些问题被查清后,不该只在工单里关掉,而应被清理、脱敏、标注,放进下一版 Agent 的回归测试里——修过一次的错误,别让它换个用户再犯一遍。对开发者而言,这也解释了为什么「单看最后一段回答」已经不够:一个十步任务若每步成功率 95%,全部正确的概率只剩约六成;而 Agent Eval 现在要同时看结果(订单、工单、文件、数据库里是否真的出现正确状态)与过程(是否跳过身份验证、是否泄露他人信息、是否反复调用收费工具)。

四、客观看:质检线不是加一个面板就有的

几点客观边界需要标注。其一,轨迹回放与评测体系的意义毋庸置疑,但「存下几十万条执行记录,却说不清哪一条只是绕了点路、哪一条已经是事故」——轨迹的自动标注与失败识别本身仍是难题,评测标准的定义高度依赖业务方,错误分类的准确性尚无统一基准;其二,Agent 轨迹往往包含敏感数据(工具输入可能含查询词、用户数据乃至凭证),在存储与回放环节的脱敏、访问控制与合规处理,行业实践仍在早期;其三,质检链路从「采集」到「告警」的完整闭环需要相当工程投入,对中小团队而言成本不低,大厂平台能力如何以可负担的方式外溢仍是开放问题;其四,观测工具再多,也无法替代「业务语义层」的判断——Agent 是否办对了事,最终需要业务系统的事实状态来锚定,工具只是让这个判断变得可能。总体而言,「质检线」的补课标志着 Agent 工程化进入深水区:当 Agent 从玩具走向工具,可靠性不再靠一句「相信模型」——可观测性兜住不确定性,评测闭环兜住业务正确性,这两件事,正在成为企业级 Agent 落地的隐形门槛。