Cloudflare 升级 AI 爬虫控制:区分搜索、训练与 Agent 机器人,广告页面默认屏蔽训练和 Agent
Cloudflare 推出细粒度 AI 爬虫控制,允许网站所有者分别管理搜索、训练和 Agent 三类机器人。自 2026 年 9 月 15 日起,广告支持页面将默认阻止训练和 Agent 爬虫。了解这对中文网站运营者和内容创作者的具体影响。
一句话看懂
Cloudflare 为所有客户提供细粒度 AI 爬虫控制,可分别管理搜索、训练和 Agent 三类机器人,广告页面将默认屏蔽后两者。
详细发生了什么
Cloudflare 宣布升级 AI 爬虫管理策略,从一刀切式屏蔽转向更精细的控制。网站所有者现在可以在 Cloudflare 控制面板中,针对 Search(搜索)、Training(训练)和 Agent(代理)三类机器人分别设置允许或阻止规则。
关键时间节点:从 2026 年 9 月 15 日起,对于使用 Cloudflare 广告支持计划的网站,Training 和 Agent 爬虫将被默认阻止。这意味着 AI 公司用于模型训练的数据抓取和自主代理的网页访问将受到限制,而搜索引擎的爬虫(如 Googlebot)则不受影响。
Cloudflare 表示,此举是为了平衡内容创作者的权利与 AI 生态的发展。此前,许多网站因无法区分良性搜索爬虫和消耗带宽的 AI 训练爬虫而选择全面封禁,现在他们可以更精准地控制。
中文圈视角
对于中文网站运营者和内容创作者来说,这个更新意义重大。国内很多网站依赖广告收入,而 AI 训练爬虫(如 OpenAI、Anthropic 的爬虫)会大量抓取内容却不带来流量或收益。Cloudflare 的新控制让站长能直接屏蔽这些“只拿不给”的爬虫,同时保留搜索引擎的收录权限。
不过,国内用户需要注意:Cloudflare 的免费计划是否包含这些细粒度控制?原文提到“所有客户”,但免费版可能功能受限。此外,国内主流 CDN 服务商(如阿里云、腾讯云)目前尚未提供类似功能,中文站长可能需要通过 robots.txt 或第三方工具手动管理,效率较低。
另一个盲点是:国内 AI 公司的爬虫(如百度文心、阿里通义千问的训练爬虫)是否会被 Cloudflare 识别?Cloudflare 的爬虫数据库主要基于海外 AI 公司,对国内爬虫的覆盖可能不足。站长需要额外配置规则来屏蔽国内 AI 爬虫。
几条值得记住的细节
- Cloudflare 将 AI 爬虫分为三类:Search(搜索引擎)、Training(模型训练)、Agent(自主代理,如 AI 助手)。
- 广告支持计划用户从 2026 年 9 月 15 日起默认阻止 Training 和 Agent 爬虫。
- 网站所有者可以随时在控制面板中调整规则,允许或阻止特定类别。
- 此功能对所有 Cloudflare 客户开放,包括免费计划用户(但可能功能有限)。
- Cloudflare 表示将定期更新爬虫数据库,以识别新的 AI 爬虫。
一句话总结
如果你是网站站长,现在可以用 Cloudflare 精准屏蔽 AI 训练爬虫,保护内容不被免费抓取,同时不影响搜索引擎收录。