2026年9月15日,网络基础设施服务商 Cloudflare 宣布正式上线名为 Disallow AI Training 的全新安全设置。这项功能试图解决自生成式大模型爆发以来困扰全球站长已久的死结:在保住搜索曝光的前提下,阻止巨头将网页内容抽走训练 AI。
表面上看,这是一次为数字内容创作者争取主权的重大工具更新。但在技术底层,它并非一次真正意义上的网络隔离,而是基础设施服务商代表站长群体,与搜索引擎巨头达成的一场基于黑盒信任的城下之盟。
复合爬虫的二选一困局:少于1%的屏蔽与17%的反抗
在传统互联网秩序中,内容所有者与搜索引擎维持着三十年未变的情感默契:站长开放抓取,引擎反馈超链接流量,双方各取所需。但生成式 AI 的崛起彻底砸碎了天平。Google、微软和苹果为了喂饱底层模型,均采用了复合用途爬虫机制,即由 Googlebot、Bingbot 或 Applebot 单一代理同时承担搜索建库与模型训练两种完全不同的抓取任务。
这种抓取绑定直接演变成一种变相的技术挟持。网站如果从服务器根源拦截爬虫,就会在传统搜索结果中瞬间蒸发;如果放行爬虫,辛苦耕耘的原生图文就会无偿沦为大模型参数。出版集团 People Inc. 首席执行官 Neil Vogel 此前曾公开指责,Google 将搜索抓取与 AI 训练绑定的做法是赤裸裸滥用市场支配地位。
数据揭示了站长群体内心的深重撕裂。在 Cloudflare 服务的全部网络站点中,不足1%的站点会选择屏蔽常规搜索爬虫,这意味着绝大多数网站仍将搜索引擎视作赖以生存的生命线;与此同时,已有 17% 的站点选择开启屏蔽机制抵御 AI 训练。
面对这种不对等,Cloudflare 拿出的方案并非全网一刀切。针对 OpenAI、Anthropic、Meta、Amazon 等厂商旗下的独立训练爬虫,Cloudflare 会在边缘网络节点执行硬拦截,直接阻断网络连接;而针对兼具搜索与训练的复合爬虫,系统则选择充当声明代理人,通过 Bot Preference Sync 机制代站长在 robots.txt 中下发拒绝训练的指令。
硬拦截与软声明的分野:巨头的黑盒信任与2027年时间差
当技术防御退化为协议声明,这场博弈的性质就从硬性防火墙变成了君子协定。
Cloudflare 为复合爬虫设立了一套名为 Accountable 的合规准入标准。爬虫运营方必须满足四项核心要求:提供训练退出机制、提供 AI 摘要退出机制、提供 URL 级别的训练数据透明度与搜索指标展示,以及保证退出训练不影响传统搜索排名。然而细究各巨头的履约节奏,行业标准实际上千差万别。
Google 目前支持通过 Google-Extended 标识退出训练;苹果支持 Applebot-Extended,但其承诺的 URL 级别透明检查工具要等到 2027年 才能面世;微软的进度更为滞后,Bingbot 现阶段仅支持页面级元标记 NOARCHIVE,在域名级生效的 robots.txt 声明支持同样被推迟到了 2027年初。
更棘手的隐患藏在工程细节中。微软必应官方文档清楚写明,如果站长在页面中同时配置了 nocache 与 noarchive 标签,Bing 将按照允许展示有限内容与训练的 nocache 规则处理。这意味着在 2027 年微软兑现全域声明支持之前,依赖 Cloudflare 统一部署的站长若未在页面手动排查元标记冲突,防御体系在微软面前将直接失效。
所谓合规保障,不过是把原本在暗处的数据抽取,换成了不可验证的黑盒承诺。
数据流并没有被切断,服务器依然向巨头全量吐出内容。爬虫将图文打包回数据中心后,究竟有没有送进训练集群清洗,外部站长根本无从取证。
防住训练防不住摘要:40%流失与3至5倍转化的割裂
许多站长误以为开启了 Disallow AI Training 就能保住版权与流量,这恰恰掩盖了真正的正面战场:零点击截流。
Google 开发者文档中有一项明确但常被忽略的规定:屏蔽 Google-Extended 仅代表禁止内容被用于未来 Gemini 模型的二次训练以及部分非搜索系统,它不能阻止内容被抓取并呈现在 Google AI Overviews 或 AI Mode 中。生成搜索摘要的行为在巨头的技术定义里仍然归属于常规搜索索引,站长若要彻底阻断内容被大模型清洗并重写为摘要,只能借助 nosnippet、data-nosnippet 甚至 noindex 标签。
这种技术割裂正在直接摧毁依托广告生存的 Web 出版模式。调研表明,超过 50% 的消费者在搜索过程中习惯直接阅读 AI 生成的摘要;而阅读了摘要的用户,结束搜索且不再点击任何来源外链的概率足足高出40%以上。当读者停留在搜索结果页面直接拿走答案,网站即使免于被训练模型,也同样失去了赖以存活的真实访客与广告曝光。
更深层的拉扯发生在内容机构内部。出版商的法务与版权团队倾向于全面封锁爬虫,以此逼迫 AI 平台签订商业授权;但负责受众增长的 SEO 团队却极度焦虑,因为业界报告显示,由 AI 搜索推荐带来的定向流量,其转化率往往是传统搜索引流的 3倍至5倍以上。过激的技术防御不仅意味着放弃现有展现,更意味着提前出局下一代高转化流量池。
- 风险.若全域启用 Disallow AI Training 却未在页面级同步布控 nosnippet 标签,网站不仅无法防住 Google 搜索页内的内容摘要清洗,还可能在微软 2027 年更新前因标签冲突继续开放训练。
Cloudflare 的新举措确实为混乱的爬虫生态划出了一条规整跑道,让站长免于在彻底断流与彻底出卖之间被动二选一。但只要搜索引擎的商业模式继续向 AI 生成答案靠拢,依靠一张由巨头自行解释的声明清单,就永远无法解决内容变现体系被系统性抽干的生存危机。
