#024
2026-08-05

AI 爬虫三大分类时代来临:Cloudflare 揭示 25% Bot 流量来自 AI,robots.txt 已不够用

📰 想看更多新闻?
浏览完整新闻列表

如果你以为robots.txt 还能完全控制谁可以爬你的网站,那现在可能该重新思考了。Cloudflare 最新的研究数据揭示了一个令人不安的事实:2026 年 5 月,AI 相关的爬虫已经占据验证 Bot 流量的 20.3%,如果再加上 AI 搜寻类型的爬虫,比例达到 四分之一。这意味著每四封来自机器人的请求中,就有一封跟 AI 有关。

更关键的发现是——不是所有 AI 爬虫都一样。把它们统统一封锁,可能会让你付出比想像中更大的代价。

为什么你无法再用「一刀切」的方式处理 AI 爬虫?

过去我们习惯把 Bot 流量当成一个整体来看待——不是真人就是机器人,挡掉就对了。但 Cloudflare 的研究指出,AI 爬虫实际上应该分为三个截然不同的类别,而封锁它们的后果完全不同:

一、训练型爬虫(Training Crawlers)

GPTBot、ClaudeBot、Google-Extended 属于这一类。它们收集你的网站内容,可能最终被用于训练大型语言模型的参数。封锁它不会让任何人无法看到你的网页——只是你的内容不会成为 AI 模型的「知识库」的一部分。对大多数企业来说,短期影响几乎为零。

二、检索型爬虫(Retrieval Crawlers)

OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot 在这里。这才是你需要小心的地方。这些爬虫建立的是 AI 搜寻引擎的即时索引——当有人在 ChatGPT 或 Claude 中搜寻你的行业相关问题时,如果它们没有抓到你的页面,你就会从回答的引用来源中完全消失。封锁检索型爬虫 = 主动退出 AI 搜寻结果

三、使用者触发型爬虫(User-Triggered Crawlers)

ChatGPT-User、Claude-User、Perplexity-User。这类请求发生在「真人」主动要求 AI 读取你的特定页面时——比如一个潜在客户问 ChatGPT「帮我看看 Lafa System 的资安防护方案怎么说」。如果你封锁了这些爬虫,等于在潜在客户做研究的时候直接拒绝他们

数据说话:谁被挡得最多?

Cloudflare 第一季度统计显示,GPTBot 是被 robots.txt 封锁最频繁的 AI 爬虫,出现在 5.52% 的 DISALLOW 规则中,紧随其后的是 CCBot(5.08%)和 ClaudeBot(4.88%)。但研究同时发现,大约 80% 的 AI 爬虫流量来自训练型——也就是说,大部分被封锁的其实是不会造成直接损失的那一类。

真正危险的是:很多资安团队在设定 WAF 或 CDN 规则时,根本没有区分这三类。一条简单的「阻挡所有非 Google 搜寻引擎爬虫」的规则,可能同时杀死了你的品牌在 ChatGPT、Perplexity 和 Claude 中的可见度。

CDN 层的防御正在取代 robots.txt

robots.txt 的问题一直存在——它只是一份「礼貌请求」,无法真正阻止不遵守规则的爬虫。但到了 AI 时代,这个问题变得更加突出:

Cloudflare 的下一步:9/15 预设封锁训练和 Agent 爬虫

Cloudflare 宣布在 2026 年 9 月 15 日,新注册的网域将预设封锁「训练型」和「Agent 型」AI 爬虫在显示广告的页面上,但搜寻类型的爬虫保持允许。这个方向很明确:把「可被搜寻到」和「被拿去训练模型」分开管理

对内容出版商来说,这或许是好事——你的文章可以被引用但不被训练。但对 B2B 服务商而言,如果 ChatGPT 无法即时读取你的方案页面,潜在客户的转换漏斗就断了。

中小企业的实际困境:看不见的成本

AI 爬虫产生大量无效流量,消耗的是你的 CDN 频宽和请求配额。根据 Cloudflare 的数据,验证 Bot 流量的四分之一来自 AI——这意味著如果你的网站每月被 Bot 消耗了 10 万次请求,其中约 25,000 次就来自 AI 爬虫。这些请求不会转化成客户,但会真实地增加你的 CDN 成本

问题是:大多数中小企业没有资源区分「有价值的爬虫流量」和「纯消耗成本的爬虫流量」。他们只看到帐单上的数字在增长,却不知道怎么精细过滤——结果要么全挡(失去搜寻能见度),要么全开(白付 CDN 费用)。

未来趋势:付费爬取与授权模式

Cloudflare 已经推出了「pay-per-crawl」模型,让出版商可以对 AI 公司的抓取行为收费。这意味著未来的规则不再只是「允许或禁止」,而是走向「授权与计价」的新阶段。对于需要被 AI 搜寻索引但同时要控制成本的企业来说,这或许是唯一平衡的解决方案。

💡 LAFA 观点

AI 爬虫流量已占四分之一 Bot 请求,靠 robots.txt 手动管理根本来不及。Lafa System 的 AI 自动运维能在 CDN 层即时识别三类 AI 爬虫、智能调整过滤规则——保留检索型爬虫维持搜寻能见度,同时精确封锁消耗成本的训练型爬虫,让你的 CDN 费用真正花在值得的地方。