#030
2026-08-26

Cloudflare 9/15 起默认封锁 AI 训练与 Agent 爬虫:你的 CDN 账单要开始分账了

📰 想看更多新闻?
浏览完整新闻列表

2026 年 7 月 1 日,Cloudflare 在 Content Independence Day 第二届活动中,正式把过去「AI 爬虫挡或不挡」的二元选择,拆成三个独立开关:Search、Agent、Training。这不是单纯的命名游戏,而是 CDN 成本与引用权的重新分配。

9 月 15 日起,针对新接入的域名、既有客户新增的网站,以及所有免费方案客户,只要页面上有显示广告,就会默认封锁 Training 与 Agent 类爬虫,Search 则继续放行。换句话说,付费方案的旧网站可维持原设置,免费方案挂广告的小站最容易被自动改写。

三类爬虫,三种商业后果

Cloudflare 指出,AI 爬虫已占已验证 Bot 流量的 20.3%,加上 AI 搜索 Bot 6.5%,约四分之一的合法 Bot 负载与 AI 有关。Training 型占 AI 爬虫流量近 80%,但带回的价值最低。过去多数团队只看到「爬虫流量很大、很吵」,把三类一网打尽,结果是省了一点 CDN 成本,却同时封掉了 Search 引用。

混合爬虫的陷阱:Googlebot 以最严规则判定

实务上 Googlebot、BingBot 等爬虫同时做搜索索引与训练资料收集,是典型的「两栖爬虫」。Cloudflare 的处理是依所有行为以最严规则判定:若你选择挡 Training,这些混合爬虫会被一并挡掉,即使它同时也在做你想要的搜索索引。这迫使站长必须在「挡训练」与「保住 AI 搜索引用」之间做出选择。

此外,Cloudflare 也推进 Pay Per Crawl 内测,并朝 Pay Per Use 方向发展:内容被用进 AI 生成的答案才计费,而非单纯抓取次数。目前公开合作伙伴仅有 Ceramic.ai 与 You.com,机制仍在早期。

WAF 需要从「挡不挡」变成「分类管」

9/15 之后,单纯二元阻挡已经不够。企业需要的是能辨识爬虫类别、意图与商业价值的边缘治理:让 Search 进来、Training 挡掉、恶意流量封锁,同时把 WAF 政策与 robots.txt 意图自动对账,避免无声的引用权损失。

💡 LAFA 观点

阻挡无效爬虫的核心不是全封,而是分类分账。雷飞速位的 AIOps 方案会在边缘持续辨识 Search/Agent/Training 三类流量,让 Search 带回引用、Training 降低 CDN 成本、恶意 Bot 直接封锁,同时自动对齐 WAF 与 robots.txt,避免你因为一次 429 就永久消失在 AI 搜索答案里。