流量结构变了:非人流量已过半
Cloudflare 在 2026 年 7 月的公告里判断,自动化智能体与爬虫已驱动超过一半的网页请求,AI 正成为获取信息与开展商务的新接口。多数站点希望被 AI 发现,但靠广告或订阅变现的站点,不愿免费把内容喂给训练。于是 Cloudflare 把 AI 流量按行为拆成三类:Search(为回答问题而索引)、Agent(实时代替人执行动作,如聊天抓取、浏览器使用型智能体)、Training(取内容训练或微调模型,含 Search 加 Training 的混合用途)。
9/15 默认规则:广告页上 Agent 与 Training 默认拦,Search 放
自 2026 年 9 月 15 日起,所有新接入 Cloudflare 的域名,在展示广告的页面上,Training 与 Agent 两类默认拦截,Search 默认允许。广告被视为「站点主希望真人落地并看到」的变现信号,因此把可能夺走注意力的 Agent 与 Training 挡在外面;Search 最能自然回流访客,故默认放行。既有免费客户若此前未改设置,也会在 9/15 被套用这套默认;客户随时可在安全设置里改回。
混合用途爬虫成重点:Googlebot、Applebot、BingBot 受影响
另一项同步变化:同时结合 Search 与 Training 的多用途爬虫,将按其全部行为中最严格适用的规则处理。由于默认采用最严格规则,像 Googlebot、Applebot、BingBot 这类混合爬虫,一旦客户选择拦截 Training(无论是新选项还是旧「Block AI bots」),都会被拦。Cloudflare 呼吁混合爬虫把 Search、Agent、Training 分开标注,让站点主能选择。
配套:BotBase 可见性面板与 Attribution 洞察
面向企业客户,Cloudflare 推出 BotBase——一个追踪所有已知机器人(含已验证 bot 与 agent)的数据库与可搜索视图,后续将扩展为已知自动内容的中控台。同时推出 Attribution Business Insights 面板,让业务方(而非仅安全团队)看清 AI 爬虫如何消费内容、各 AI 公司实际回流多少真人流量,缓解长期的数据不对称。
对智能体生态的连锁影响
这条默认规则把「内容归谁、智能体能否抓取」从个案协商变成平台级默认,直接影响依赖公开网页取数的智能体(尤其是浏览器使用型 agent 与训练型爬虫)。对内容站点是更清晰的取舍杠杆;对智能体开发者,则意味着公开网页不再是无需许可的取数池,需要走授权或合作通道。今天是 9/15 生效日,相关默认已落地。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
结语
Cloudflare 的 9/15 新政把「你的内容,你做主」落到默认规则层。Search、Agent、Training 三分法之下,智能体抓取公开内容将更依赖显式授权。对做智能体的团队,公开网页作为免费数据源的时代正在收紧。