它不是在挡 AI,是在逼爬虫方把两件事拆开
这套机制的核心不是「默认阻止」,而是那个挤压:只要你选择阻止 Training,一个把训练和搜索打包在同一个爬虫里的运营方就会被整体挡掉——搜索收录也一起没了。代价落在不肯拆分的那一方。 过去站长面对的是一道假两难:要么接受自己的内容被拿去训练,要么退出搜索,因为同一个机器人两件事都干。Cloudflare 做的是把这道两难原样转嫁回爬虫运营方——想继续被收录,就把搜索爬虫和训练爬虫分开申报。 所以今天真正的新闻不是默认值变了,而是**苹果、谷歌和微软已经实现或承诺遵守**同日上线的 Disallow AI Training 设置。这套机制成立的前提就是三家搜索入口愿意把两件事分开;它们点头了,站长才第一次有了「保留搜索、拒绝训练」这个选项。另有一个 Accountable 认定:被认定「负责」的混合用途爬虫在搜索上继续放行,而其余训练爬虫一律阻止——包括亚马逊、Anthropic、Meta、OpenAI 那些纯训练爬虫,挡掉它们并不影响搜索。
今天该去后台看一眼,而不是等下次
规则的继承方式决定了两种人各有各的风险,而且方向相反。 如果你是**现有付费客户**,你的设置没被改动。听起来安全,实际含义是:你可能以为新默认已经保护了你,其实没有。 如果你是**免费套餐、新接入的域名,或者现有账号下新加的站点**,默认已经变了——带广告的页面上 Training 和 Agent 现在是阻止状态。这可能挡掉了一些你本来希望放进来的访问,比如某些用户指示的 agent。 两种情况都指向同一个动作:现在去 Cloudflare 控制台的安全设置里检查 AI bot 策略。默认值昨天已经翻转,这是一次复核,不是预防。顺便留意旧的「Block AI bots」选项同日弃用,如果你的配置还依赖它,需要迁移。
几个数字解释了为什么会有这套东西
混合用途爬虫现在占 Cloudflare 网络上已验证爬虫流量的 36.6%,是最大的单一类别;它的市场报告称网络上 52% 的爬虫请求现在服务于 AI 训练,而 2025 年春季这个比例是 22%。另一边,不到 17% 的站长对 AI 训练做过任何限制,不到 1% 的站点阻止搜索机器人。 在这样的分布下,默认值的影响远大于任何单个站点的主动选择——这也是 Cloudflare 把动作做在默认值上而不是做成一个开关的原因。商业层同步换了口径:Pay Per Use 取代按次抓取计费的 Pay Per Crawl,起步合作方是 Ceramic.ai 和 You.com。 需要保留的疑问有三处:「显示广告的页面」如何判定没有细则,是检测广告脚本、靠客户声明还是别的方式;某个爬虫归到哪一类由 Cloudflare 决定,且可能变更而不通知站长;以及 robots.txt 在这里依然只是偏好声明——Cloudflare 自己说得很直接,遵守 robots.txt 是自愿的,真正的执行靠 AI Crawl Control。
via: Cloudflare 官方博客:混合用途爬虫的可问责机制、TechCrunch 报道、Help Net Security 报道