Cloudflare 的新默认值 9 月 15 日生效:带广告的页面默认挡掉训练与 agent 爬虫,苹果谷歌微软同意把搜索和训练拆开
Cloudflare 7 月 1 日宣布的政策于 9 月 15 日正式生效:在任何显示广告的页面上,默认阻止「混合用途」爬虫。它把爬虫按行为分成三类——Search(为搜索索引抓取,默认允许)、Training(为训练或微调抓取)、Agent(用户指示的 agent 代表人访问页面),混合用途指一个爬虫同时做 Search 和 Training。新默认适用于新接入的域名、现有客户新增的站点以及所有未退出的免费套餐账号;现有付费客户保持既有设置不变。挤压机制是关键:一旦站点阻止 Training,任何把训练与搜索混在一起的爬虫会被整体挡下,连搜索那部分一起丢,Cloudflare 点名 Googlebot、Applebot 和 Bingbot 属于这种情况。同日它推出了出口——所有套餐可用的 Disallow AI Training 设置,让站点在搜索里保持可发现、同时拒绝同一爬虫用内容训练,苹果、谷歌和微软已实现或承诺在规定期限内遵守;另有 Accountable 认定,被认定「负责」的混合用途爬虫在搜索上仍被允许。旧的「Block AI bots」选项同日弃用。











