2026 年的 CDN 与 Bot 流量版图已经彻底改变。Cloudflare 的最新测量显示,AI 爬虫已占所有「已验证 Bot 流量」的 20.3%,再加上 AI 搜寻 Bot 的 6.5%,等于约四分之一的合法 Bot 负载都与 AI 有关。这代表你的 CDN 帐单、伺服器的 I/O 与 log 处理成本,都有一部分是被 AI 爬虫消耗的。
但真正被多数资安团队忽略的,不是「AI 爬虫很多」,而是——你的 WAF 很可能正在无声地阻挡那些让你的服务被 AI 引用、被搜寻到的爬虫。而这种阻挡,往往连行销团队都不知道。
把「AI 爬虫」当成同一类来处理,是所有错误的起点。实际上 2026 年值得关注的 AI 爬虫可分成三个截然不同的类别,阻挡每一类的后果完全不一样:
Cloudflare 的数据显示,Training 型占了 AI 爬虫流量的近 80%——量最大的一类,恰恰是阻挡代价最低的一类。多数资安团队看到的是「爬虫流量很大、很吵」,于是把最吵的 Training 型与最安静、但最决定引用权的 Retrieval 型一网打尽。结果就是:你省了一点 CDN 成本,却失去了 AI 搜寻的能见度。
更棘手的是,WAF 规则会覆盖 robots.txt。你的 robots.txt 可能写著「允许 OAI-SearchBot」,但如果边缘的 WAF 规则(或某个 2022 年写的「阻挡未知 Bot」老规则)没有更新,爬虫实际到达你源站的次数会是零。而你的 dashboard 上看不出来——因为被挡的请求根本不会计入成功流量。
这就是「无声」的危险:它不出现在任何告警、任何报表里,只是静静地让你的服务在某个 AI 搜寻产品的答案里消失。要验证,必须去翻源站 log,用爬虫的 User-Agent token 逐一比对,才能发现 Retrieval 型爬虫的命中数其实长期挂零。
Cloudflare 将于 2026 年 9 月 15 日起,对新接入的域名引入三类 AI 流量的独立预设:在展示广告的页面上,Training 与 Agent 预设被阻挡,Search 维持允许。这代表「一笔封锁」的二元时代正在结束,取而代之的是分类的、有意识的 Bot 政策。
但这也带来新的风险:如果你的资安团队在 9/15 之后才开始分类管理,很可能会不小心把 Search 型也一并挡掉。真正的解法,不是「全开」或「全关」,而是让 AI 帮你做这个分类判断。
阻挡 AI 爬虫最贵的错误不是「挡太多」,而是「挡错」——一次 429 或 403,就可能让你的服务永久消失在某个 AI 搜寻答案里,而且你根本不会收到任何通知。雷飞数位的 AIOps 方案会在边缘持续辨识每种爬虫的类别与意图,让 Search 进来、Training 挡掉、恶意流量封锁,同时把「你的 WAF 政策」和「你的 robots.txt 意图」自动对帐,避免这种无声的引用权损失。