过去一年,关于「智能体能否被信任」的讨论,大多停留在能力层面。而 Anthropic 发布的 9 月威胁情报报告,给出了一个更具体的观察角度——在真实发生的滥用活动里,智能体扮演的角色正在从「出主意」变成「动手做」。这个转变的含义,比事件数量的增加更值得警惕。
报告的核心判断
据公开信息,这份报告覆盖了 2025 年 12 月至 2026 年 8 月期间其处置的多类滥用活动,范围横跨网络行动、影响力行动、监视、诈骗、生物误用、常规武器相关工作以及非法蒸馏等。报告涉及的参与者包括疑似国家关联组织、以经济动机为主的犯罪者、间谍软件厂商、宣传机构以及个人使用者。
其中最值得停留的是一条结构性判断:报告称,其记录的多数网络行动中,AI 直接执行或协调了侦察、利用与数据外泄等步骤,而人类更多负责选择目标与复核结果。报告还提示,公开可得的攻击性智能体框架,正在进一步降低发起自动化攻击所需的定制工程量。由此得出的结论相当直白——「复杂性已经不再是判断幕后组织的可靠信号」。报告同时说明,公开的案例是「显著例子」,而非典型用法。
为什么「从建议到编排」是一个转折
理解这个转折,需要回到 AI 风险讨论的演变。早期的关注点集中在「生成有害内容」——模型输出什么。而当模型开始调用工具、串联步骤、在失败后重试时,风险的性质发生了变化:它从「信息」变成了「动作」。一次有害输出最多是一次信息泄露或误导,而一段被自动化执行的攻击链,会真实地改变系统的状态。
这也解释了为什么「智能体安全」的重心正在从内容过滤转向运行时控制。当模型只是给建议,防御的落点在输入端;当模型直接执行动作,防御的落点就必须落到权限、凭证、出口与审计这些运行时要素上。攻击者能力的提升,本质上是把「人肉执行」的环节替换成了「可规模化复制的自动化」。
对防御方的三条现实含义
报告给出的建议方向,可以归纳为三条。其一,从静态签名转向行为化防御。当攻击者可以用很低的成本重新生成工具、变换手法时,基于已知特征的拦截会持续滞后;相反,假设对手能够廉价地再生工具与改变战术,把重点放在行为基线的偏离检测上,更符合当前威胁形态。其二,收紧身份与出口边界。短时凭证、最小权限、出口流量控制、受保护的构建系统,这些措施的共性是把「一次失陷」的后果限制在有限范围内,避免被放大成整条自动化攻击链。其三,把内部部署的智能体当成同等威胁面来审视。企业内部出于提效而部署的智能体,往往被授予了较宽的工具权限;一旦它被劫持,过度的权限就会把一次普通失陷放大为一次自动化行动。
把这条建议与近期的一系列安全事件放在一起看,指向是明确的。无论是被用于大规模协同攻击的编程智能体,还是被国家级组织用来制作钓鱼诱饵的开源编程工具,都说明攻击者已经把智能体纳入了常规攻击链。而行业侧,围绕智能体身份鉴别、运行时安全的团体标准也已启动——防御的标准化,正在与威胁的规模化同步推进。
中立思辨
需要保持中立的视角。其一,这份报告由模型厂商发布,案例的选取与披露范围会受其立场、客户关系与法律约束的影响,「多数」这类表述的口径并未量化,读者应把它当作厂商视角下的观察,而非穷尽式的统计。其二,「AI 执行」与「人类决策」的边界在实践中往往难以清晰划分——一个由人选定目标、由 AI 完成步骤的行动,究竟算谁的,取决于如何定义责任,而报告并未给出判定方法。其三,报告同时说明公开案例是「显著例子」而非典型用法,这意味着从这些案例外推整体趋势时需要谨慎。其四,防御建议的方向合理,但落地成本不低——行为检测、短时凭证与出口控制都会增加系统的复杂性与运维负担,中小企业能否承担仍是现实问题。其五,相关案例的完整技术细节与处置方式,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
趋势研判
短期,企业会把内部智能体的默认权限收紧到最小必要,并补齐全量审计与出口控制,因为这是成本相对可控、收益相对确定的动作;中期,「智能体身份 + 运行时安全 + 行为检测」这一组合,可能从可选项变成生产环境的准入门槛,尤其是在金融、政务等受监管行业;长期,攻防双方都会进一步走向自动化,胜负将取决于谁能更快地更新行为基线——这更像一场持续的检测能力竞赛,而不是一次性的加固。
对企业的务实建议是:把内部部署的智能体当成「持有凭证的内部人员」来管理——给它明确的职责边界、可撤销的凭证、完整的操作留痕,以及一条能在异常时快速切断的路径。在智能体从「建议」走向「执行」的阶段,控制它的行动能力,比限制它的知识范围更重要。