企业 AI Agent 的热度与落地率之间,横着一道刺眼的鸿沟。CIO.com 援引 IDC(与联想合作的)研究给出一组被反复引用的数字:每启动 33 个 AI 概念验证(POC),大约只有 4 个能进入规模化部署——也就是约 88% 从未真正投产;另有口径显示,78% 的试点被视为成功,但最终走进生产的只有 12%。表面看是「技术不行」,深一层看,失败的大多是治理与范围界定,而不是模型。

一、试点成功 ≠ 生产可用

试点之所以容易「成功」,是因为它被设计成受控实验:精选数据集、临时算力、有限用量、靠人肉兜底解决故障,衡量标准是模型准确率或 demo 效果,而非业务影响。生产系统面对的是另一套现实——不一致且持续变化的真实数据、与既有系统的集成、合规约束、在波动负载下稳定长跑。很多 Agent 在干净边界数据里表现良好,一进生产就被长尾case 打回原形。换句话说,沙箱从未诚实回答过「能否规模化」这一题。

二、两类根因:范围失焦与治理缺位

第一类是范围失败:团队做了一个「什么都能做一点」的宽泛 Agent,却没有先定义清楚什么叫成功。结果它每件事都勉强能跑,却没有一件事好到值得上线, stakeholder 指不出可衡量的业务成果,采购算不回 ROI,试点便永久停在试点。第二类更隐蔽也更危险:治理缺位。Agentic 系统能调工具、查库、发邮件、改 CRM、跑工作流,且常在无逐步人工确认下执行;若治理层没在 Agent 碰生产数据前就位,就是实打实的风险。提示注入已在真实生产系统里被利用,而未把权限审计、最小授权、身份校验算进原始预算的团队,往往会低估三年总拥有成本。

三、从「买 Demo」到「建平台」

能走通生产的组织,几乎都在做同一件事:用平台思维替代孤岛项目。统一开发、部署与治理,让数据科学家少花时间在清洗与排障上,让领域专家也能直接参与搭建;治理不是试点期的可选项,而是从第一行 Agent 代码之前就该内建的能力。对正在规划 Agent 的团队,这条 88% 的曲线最现实的启示是:在写代码前先回答三个问题——这件事到底适不适合用 AI、组织能否长期供养这套系统、业务会不会真的接纳并持续使用它。把治理前置,比换一个更强的模型更能决定 Agent 是上线还是烂尾。