一份覆盖 150 个生产级企业智能体部署的实证研究,把「自主权」拆成了可度量的档位。结论和很多演示里的豪言相反:真实落地里,站得最稳的部署不是自由度最高的系统,而是能在权限、阈值、工具和异常状态围成的围栏里自主行动的系统。研究用 A1 到 A4 给部署分级——A1 只读、A2 人审动作、A3 有界自主、A4 端到端自主——样本里没有任何一例进入完全自主的 A5。
从「能不能调工具」到「敢放多少权」
研究先纠正了一个常见误解:智能体赛道的瓶颈早已不是模型能不能调工具,而是企业愿意让系统在生产规模上反复做什么。在它冻结的 150 例样本里,占比最大的自主权档位是 A3 有界自主行动,共 57 例;其次是 A2 人审动作 45 例、A1 只读 31 例、A4 端到端自主 17 例。A3 与 A4 合计占样本的 49.3%。这个分布本身就在反驳「越自主越好」的叙事——大多数稳下来的生产系统,停在了有界自主这一档。
A3 有界自主:数量最多、证据最硬
更关键的是证据质量,而不只是数量。研究给每个部署打了「证据分」,A3 平均 76.6 分(满分 100),91.2% 的 A3 部署披露了量化结果,94.7% 达到中等或以上证据门槛。相比之下,A4 系统虽然亮眼,但更稀少、测量也更参差。A1 系统文档可以很完整,可它不往业务系统里写东西,影响天然有限。也就是说,当下最容易被验证、也最常被验证有效的,是有界自主这一档。
A2 人审动作:常见却是弱环
真正值得警惕的是 A2。它数量不少(45 例),平均证据分却只有 63.1,只有 53.3% 披露了量化结果,55.6% 达到中等或以上门槛。这不代表 A2 是坏架构,而是它的构成里塞满了支付、受监管决策、商务动作、理赔这类「agent 能准备或发起、但关键一步仍由人授权」的工作。技术上的动作往往先于成熟的业务度量——尤其在支付场景,公开证据常先证明 agent 能在权限与认证下完成交易,却还没证明成本更低、处理更快、损失更少。换句话说,A2 卡在「能做」到「能度量」的中间地带。
真实样本里的硬指标
研究里两个例子把抽象分级落到地上。C.H. Robinson 的运费报价 agent 属于 A3:它评估专有数据并自动发出客户专属报价,报价覆盖率从约 60% 到 65% 提升到百分之百,平均响应时间从 17 到 20 分钟压到约 32 秒,人仍负责战略与异常处理。更高一档的 Glide Slipstream 工程管线属于 A4:它能构建、验证、部署、监控、诊断、开修复并自动回滚劣化版本,合并到生产的时长中位数从 23 小时降到 14 分钟——但它活在带版本控制、测试、可观测状态和可逆动作的工作流里,正是这些条件让自主变得可信。
对「全自主」叙事的冷思考
这项研究给行业提了个醒:把「全自主」当成终点,容易忽略一个事实——自主的价值不在自由度本身,而在可度量的结果与可控的边界。A3 成为证据甜区,是因为它既放开了日常路径,又把权限、阈值和异常状态锁在围栏内;A2 成为弱环,是因为它常停在「能做」却没补齐度量。对打算上量的企业,更现实的路线不是追 A5,而是先把 A3 的围栏做扎实,再把少数高价值链路谨慎推到 A4。目前该数据集的方法口径与更多细分结论,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。