Cloudflare 9月起默认拦截AI代理爬虫,中文用户需了解权限获取方法
Cloudflare 宣布从9月15日起默认拦截AI代理爬虫,将爬虫分为搜索、代理和训练三类。本文详解新规对中文用户的影响,包括如何获取权限、对国产AI代理的潜在冲击,以及广告页面内容访问受限后的应对策略。
一句话看懂
Cloudflare 将从9月15日起默认拦截AI代理爬虫,要求所有AI代理必须获得许可才能访问广告支持的网页。
详细发生了什么
Cloudflare 在7月1日宣布了一项重大变更:从9月15日起,其网络将默认拦截AI代理爬虫(即代表用户实时抓取页面的机器人)。Cloudflare 将爬虫分为三类:Search(搜索爬虫,用于索引页面供后续回答)、Agent(代理爬虫,如ChatGPT的fetch bot和浏览器驱动代理,实时操作用户请求)、Training(训练爬虫,将内容拉入模型权重)。新控制选项已对所有客户(包括免费套餐)开放。从9月15日起,对于显示广告的页面,Agent和Training类爬虫将被默认拦截,Search类仍允许。新默认设置适用于新加入Cloudflare的域名、现有客户的新站点以及所有现有免费套餐客户。不想被拦截的用户可在9月15日前通过安全设置退出。Cloudflare 的逻辑是:广告页面是为人类访问而建,搜索爬虫带来流量是引荐,而AI代理读取页面后直接给出答案则不是。
中文圈视角
对中文用户而言,这一变化影响深远。首先,国内大量网站使用Cloudflare CDN,包括许多新闻、博客和电商站点。如果你的AI代理(如基于OpenAI或国产模型的自动化工具)需要抓取这些网站的内容,9月15日后可能面临大面积访问失败。其次,国产AI代理如Kimi、DeepSeek的联网搜索功能,以及各类RAG应用,都可能因Cloudflare的默认拦截而无法获取广告支持页面的信息。这迫使国内开发者必须提前规划:要么与网站所有者协商获取权限,要么转向非广告页面或付费API。值得注意的是,国内已有类似机制,如百度搜索的爬虫白名单,但Cloudflare的拦截是网络级别的,比robots.txt更严格。对于依赖实时数据的金融、电商监控类AI代理,这可能是致命打击。此外,分类漏洞值得关注:AI公司可能将训练爬虫伪装成搜索爬虫,Cloudflare并未说明如何防止。
几条值得记住的细节
- Cloudflare 的新分类从7月1日起对所有客户开放,包括免费套餐。
- 9月15日后,广告页面的Agent和Training爬虫默认被拦截,Search爬虫仍允许。
- 现有免费套餐客户将自动应用新默认设置,需手动退出。
- Cloudflare CEO 表示希望推动混合用途爬虫分离搜索、代理和训练行为。
- 超过一半的AI爬虫流量用于重复抓取未变化的页面,存在浪费。
一句话总结
如果你的AI代理依赖抓取广告支持的网页,9月15日前必须获取权限,否则将面临内容不可达。