从管内容,到管行为
过去几年,AI 安全讨论的重心长期落在内容侧:生成的内容是否合规、是否含有害信息、是否涉及侵权。这套思路对聊天型产品是够用的,因为它的输出形态就是文本。
但当智能体开始调用工具、访问数据库、执行交易、在多个系统之间传递任务时,风险形态发生了变化。一次错误的输出可以被忽略,一次错误的写库或对外支付却会留下真实后果。防护的对象因此必须从「说了什么」扩展到「做了什么」。
一份名为《AI 安全治理技术白皮书(2026)》的文件把这一变化写进了它的核心判断。据公开信息,该白皮书由中国移动、香港电讯、YTL、百度、奇虎 360、华为、新华三、科大讯飞、中兴、北京邮电大学、复旦大学、浙江大学等多家单位共同参与撰写,MediaTek、清华大学、TÜV 莱茵等提供支持。多方合写这个形式本身值得注意:它意味着议题已经从单一厂商的产品主张,进入需要跨行业协商的阶段。
五组转变:风险清单的写法变了
白皮书的第 2 章把风险与挑战概括为五组转变:未知大于已知、攻击大于防御、演进大于治理、分歧大于共识、行为大于内容。
这种写法的价值在于它承认了一件事:当前的安全治理整体上处于追赶状态,而不是防守状态。未知大于已知,说的是风险形态的发现速度跟不上技术演进;攻击大于防御,说的是攻击面扩张快于防护手段的建设;演进大于治理,说的是规则制定的节奏落后于能力迭代;分歧大于共识,说的是国际间在治理路径上尚未收敛。
其中与智能体直接相关的是最后一组:行为大于内容。这句话的技术含义是,安全边界需要从输出审查前移到执行控制。对智能体而言,这意味着需要回答几个此前不存在的问题:它能调用哪些工具、能写哪些数据、能触发哪些对外动作、这些权限是否按任务动态收窄、动作发生前后能否留下可追溯的记录。
把这些问题与近期行业内出现的几类事件对照,方向是吻合的:当智能体被赋予写操作权限后,误操作与越权访问成为主要风险来源;当多个智能体协同工作时,风险会沿着调用链传播,单点检查不足以覆盖。
两条主线:AI 用于安全,与 AI 自身安全
白皮书把 AI 安全沿两条主线展开。
一条是 AI for Security,即 AI 作为增强安全能力的使能技术,用于漏洞发现、威胁分析、安全运营与风险评估。这条线在行业里推进得比较快,安全厂商普遍已经把模型能力接入检测与响应流程。
另一条是 Security of AI,即 AI 自身的安全,涵盖模型安全、数据安全、智能体行为、智能体间通信泄露以及供应链依赖。
第二条主线里,「智能体间通信泄露」这个提法值得单独拎出来。它是多智能体架构特有的风险:当智能体通过消息传递协作时,信息会在链条上流转,而每一跳都可能成为泄露点。一个智能体为了完成任务,可能把上游传来的敏感上下文一并转发给下游,而下游并不需要这些信息。这类泄露的隐蔽性在于,单个智能体都在正常执行自己的职责,问题出在整体链路上。
供应链依赖则是另一类常被低估的风险。智能体系统通常由模型、框架、工具、插件、沙箱等多层组件构成,任何一层引入的第三方依赖都可能成为攻击入口。工具生态越开放,这个问题越突出。
1-3-9 框架与三个主张
白皮书的核心主张可以概括为三句话:安全根植于网络、以智能治理 AI、左移协同治理。在此基础上,它提出了「1-3-9」框架,即一个愿景、三大战略、九条路径,并配套六维能力。
「安全根植于网络」这一条带有明显的产业视角。运营商与网络设备厂商参与其中,自然会强调网络层在安全治理中的基础位置——流量可视、策略下发、边界控制这些能力,确实是运行期防护的物理载体。「以智能治理 AI」则呼应了用 AI 提升安全运营效率的思路。「左移协同治理」把治理动作前移到设计与开发阶段,这与软件工程里「安全左移」的传统一脉相承。
白皮书的结构是四章:发展趋势与全球治理格局、风险与挑战、安全治理总体思路、安全治理倡议。第四章提出四项倡议,涉及发展与安全平衡、运营基础、内生治理与开放生态。
「内生治理」这个提法值得留意。它指的是把安全能力做进系统内部,而不是作为外挂的检查环节。对智能体而言,这对应的工程实践包括:权限按最小必要授予、动作前做策略校验、敏感操作强制人工确认、全链路留痕可回放。这些做法在前几轮行业讨论中反复出现,白皮书把它们收进了一个统一的框架里。
中立思辨
需要辩证看待几件事。其一,多方合写的白皮书在覆盖面上有优势,代价是主张往往趋于稳妥,落到可执行的条款与量化指标时会比较克制。1-3-9 框架给出了结构,但九条路径的具体内容、六维能力的评估方式、以及企业如何自评是否达标,公开信息中尚未展开。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
其二,参与方包含运营商、安全厂商、终端厂商与高校,各自立场不同。网络层被视为治理基础,这与运营商的核心能力高度契合,但对企业而言,真正可落地的控制点更多在应用层与数据层。读这类文件时,区分「框架的结构」与「具体主张背后的商业位置」是有必要的。
其三,治理框架的效力最终取决于两件事:有没有可核查的指标,以及有没有与之匹配的责任机制。白皮书属于技术治理层面的探索,与标准立项、监管要求之间还有距离。它更接近行业共识的整理与引导,而非合规强制。
其四,行为侧治理在技术上仍不成熟。可观测性工具能记录轨迹,网关能做策略拦截,身份体系能限制凭证范围,但这些能力目前分散在不同品类里,缺少统一接口。白皮书指出方向,落地仍需工程实践补齐。
给企业安全团队的一份对照表
把白皮书的框架翻译成可执行的检查项,大致可以得到这样一组问题。
清单与可视:企业内部现在有多少个智能体在运行,分别能访问什么,由谁负责,有没有一份随环境自动更新的台账。
权限与边界:每个智能体的权限是否按任务最小化授予,是否使用短期凭证,敏感写操作是否有独立的审批环节。
链路与隔离:多智能体协作时,消息里传递的上下文是否做过裁剪,是否按需最小化,是否禁止把上游敏感信息无差别转发给下游。
轨迹与追责:关键动作是否全程留痕,日志保留多久,能否还原一次具体执行,出错时能否定位到是模型判断、工具调用还是权限配置的问题。
供应链:模型、框架、工具与插件的来源是否可核查,升级是否有回滚方案,第三方组件的安全通告有没有纳入监控。
这五个问题都不新,但放在智能体语境下,答案往往和传统应用系统不一样——因为智能体的行为不是完全由代码决定的,它会根据上下文生成动作。这既是它的价值,也是它需要被约束的原因。