Cloudflare宣布,从现在起给所有客户——包括免费版——提供按用途管理AI爬虫的新工具,把过去笼统的"AI机器人"拆成搜索、代理、训练三类分别授权。更关键的变化在后面:从2026年9月15日起,新接入Cloudflare的域名,凡是展示广告的页面,会默认放行搜索类爬虫,同时默认拦截训练和代理类爬虫。
这不是把AI一棍子打死,而是把过去按"机器人身份"判断该不该放行的逻辑,换成按"用途"判断。听起来更精细,但网站靠曝光换流量、又不想被白嫖训练数据的老矛盾并没有被解决,只是换了个地方——谁来判断一个爬虫在做什么,谁又能真正执行这个判断。
从一键开关到三类分控
对比一下就清楚变化有多大。2025年7月,Cloudflare的方案是"Block AI Bots",一个开关,不分用途,判定是AI训练类爬虫就整体挡掉。2026年7月的新方案里,Search(建索引供日后回答问题)、Agent(实时代人办事,比如ChatGPT-User或Gemini在浏览器里点按钮)、Training(把内容永久吸收进模型)三类各有独立开关,免费版客户也能只挡训练、放行搜索。
Cloudflare同时上线了一个叫BotBase的爬虫身份数据库,能查到每个已验证爬虫具体归在哪一类。但这套可搜索的详细视图只开放给Enterprise Bot Management客户,普通和免费客户只能用三大类的粗粒度开关,看不到底层细节。
新默认规则最容易误伤谁
2026年9月15日之后新接入的域名,前提是"新接入"且"页面展示广告":Search默认允许,Training和Agent默认拦截。老域名、不挂广告的页面不受影响,网站主随时可以在Security设置里改回原状。
真正的变量是多用途爬虫。Googlebot、Applebot、BingBot这类既做搜索索引又用于模型训练的爬虫,Cloudflare的处理原则是"就地取最严"——只要客户选择挡训练,这些爬虫会被整体挡掉,连带它们的搜索功能一起消失。
想保留搜索曝光的站点,一挡训练,可能连带丢了搜索收录。
- 风险.依赖搜索流量和广告收入的媒体、独立站,需要在9月15日前主动检查设置,而不是等系统"自动帮你选对"。
robots.txt里的新字段管不住谁
Cloudflare还给robots.txt加了一个content-use字段,分immediate(只交互不留存)、reference(默认,索引摘要并回链)、full(可摘要复述)三档,让网站主标注允许对方存多少、怎么用你的内容。
但这跟robots.txt里所有其他规则一样,只是网站主写下的偏好声明,不构成技术层面的强制拦截。爬虫听不听,取决于它是否被标记为"Verified",以及运营方愿不愿意自律——Cloudflare说会对滥用信号的爬虫取消Verified身份,但这属于事后处罚,不是事前拦截。
- 结论.这一整套用途分类解决的是"允许不允许进门",而单独存在的Pay-Per-Crawl抓取市场解决的是"进门要不要付钱",两者目前没有合并成一个统一的补偿机制。
对运营搜索爬虫、AI代理或训练爬虫的平台团队来说,最实际的动作是趁早把自家爬虫按用途拆分成独立身份,否则等9月15日新规生效,一个"既搜索又训练"的爬虫,很容易在客户挡训练的那一刻,被整体请出门外。
