Cloudflare 上线禁止 AI 训练设置:搜索收录与防训练可兼得
Cloudflare 推出 Disallow AI Training 设置,同一个爬虫可以继续为搜索收录站点、同时不再拿内容训练模型,Apple、Google、Microsoft 已表态响应。设置对所有套餐免费,在域名级 Security Settings 一键开启,9 月 15 日起新域名还会按是否投放广告提供两套预设配置。
作者:核流 Admin · 栏目:资源
Cloudflare 上线了新设置,解掉站长的一个老麻烦:拦住 AI 训练时,往往连搜索收录一起牺牲。新开关 “Disallow AI Training”(禁止 AI 训练)允许同一个爬虫继续收录站点,同时不再拿抓取的内容训练模型。 麻烦的根源是“混合用途爬虫”:大厂用同一个爬虫既建搜索索引、也喂 AI 训练,拒掉一个就把另一个也拒了。绝大多数站点不想拦搜索:启用搜索屏蔽的站点不到 1%,尝试拦训练的倒有 17%。 这项设置对所有套餐免费开放,开始使用只要打开域名级 Security Settings 调一档,不用改代码。Cloudflare 会把退出训练偏好转写成 robots.txt 规则,比站长自己维护一堆指令省心。 四档设置怎么选,老用户多半不用动手 爬虫行为被分成 Search、Training、Agent 3 类,设置按域名生效,共 4 档。 Allow:全部放行,除非被其他规则或 WAF 拦住。 Disallow AI Training:偏好写进 robots.txt;合规的混合爬虫继续做搜索,其余训练爬虫一律拦截。 Block on pages with ads:只对检出广告的页面拦截爬虫。 Block:全部拦截,混合爬虫也不例外,搜索收录会同时停掉。 旧的 “Block AI Bots” 开关退役,原 Training 选了 Block 或广告页 Block 的站点,会自动迁移到 Disallow AI Training。官方口径是“多数情况下你什么都不用做”。 需要知道被拦的是谁:Amazon、Anthropic、Meta、OpenAI 这 4 家的训练专属爬虫都在拦截范围内,搜索不受影响。 9 月 15 日起,新域名开通时会按是否靠广告变现提供 2 套推荐配置。广告收入依赖真人到访,这类站点的预设更保守,之后随时能改。 落地的机制叫 Bot Preference Sync,7 月 1 日随 Search、Agent、Training 这 3 档控制上线,免费计划就能用。它生成的规则会排到站点原有 robots.txt 前面,不会冲掉旧指令。 新域名的默认档位更细:声明靠广告变现的,Training 默认 Disallow;不靠广告的站点则不预置任何拦截,怎么选留给站长。 配套博客举的例子更贴地:电商可能盼着商品被爬、被训练,聊天机器人推荐时才有话说;靠广告吃饭的出版商反过来,只要搜索收录,训练一律拒绝。同一套控制,两种活法。 需要主动动手的只有一种情形:想把混合爬虫也断干净,就自己选 Block。这一档会停掉 Applebot、Bingbot、Googlebot 这 3 家的访问,搜索收录一并停止。 三家大厂的响应方式,AI 摘要排在下一步 “Accountable” 是这次新立的认证名,从 2026 年 7 月起官方挨个沟通过。要拿认证得满足 4 项要求,最要紧的两条:退出训练不得影响搜索排名,站长得能看到自己的哪些页面被拿去训练。 3 家的接入方式各有差异。Apple 用 Applebot-Extended 规则支持退出训练,并声明这不会影响搜索排名。 Google 靠 Google-Extended 规则加上站长后台开关,还承诺几周内补上 URL 级的透明度工具,同样声明退出训练不影响排名。 Microsoft 眼下用页面里的 NOARCHIVE 元标签表达训练偏好,robots.txt 里的“不训练”指令要等 2027 年初才落地。想立刻退出,还能用它的 Block URLs 和内容移除工具。 训练是第一步,AI 摘要是第二步。至于被摘要引用的比例,官方计划 2027 年初开放粒度控制:在 Cloudflare 设一次,不用逐个运营方去谈。 官方给了两组数字:超过 50% 的访客会读搜索结果里的 AI 摘要,读完的人里超过 40% 直接结束搜索。 AI 搜索引来的访客,转化率是传统搜索的 3 到 5 倍。访客变少、意图更准,到底怎么取舍,官方不替站点拍板。 纯内容站可以先试 Disallow AI Training,广告驱动的站点多半要按新域名的保守预设调。取舍的依据就是前面那两组数字。 获取方式很直白:登录控制台,进域名级 Security Settings 就能开,新老站点一视同仁。反馈可以发到 crawlercontrols@cloudflare.com,各家运营方的合规进度由官方 Radar 持续公示。 参考资料 Cloudflare Blog:Have it both ways: stay discoverable in search while disallowing AI training Cloudflare Blog:Say it once: introducing Bot Preference Sync | Cloudflare Blog Cloudflare Docs:Bots reference | Cloudflare Docs