51Degrees 最近发布了一份基于30 亿次真实网站访问(截至 2026 年 5 月 29 日的一年)的 AI bot 流量研究,涵盖电信、媒体、零售、金流、科技等行业。三个数字值得所有付 CDN 帐单的人看一眼:AI bot 流量年增 62.5%、已占全部 web sessions 的 13%(去年还只有 8%)、而在 72 个被辨识出的 AI 相关爬虫里,AmazonBot 与 Meta-External-Agent 两家就占了 63% 的流量。
过去一年,媒体与社群讨论的 AI 爬虫几乎清一色是 GPTBot、CCBot、ClaudeBot——它们上了头条、上了法庭。但 51Degrees 的数据完全不是这么回事:单日 AmazonBot 就有 643 万次 session、占全站流量的 4% 以上;Meta-External-Agent 约 423 万次、占 3%。而大家讨论最多的 ClaudeBot 单日只有约 28.8 万次,排在第七名;OpenAI Search Bot 约 12.9 万次,排第九。前四大爬虫(AmazonBot、Meta、AhrefsBot、BingBot)就吃掉了全部爬虫 session 的 85%。
更关键的是「负载形态」不同。Known Agents 把 AmazonBot 描述成「广度极高的大规模扫抓,每次访问抓取的页面远多于一般搜寻爬虫」。这种 load profile 跟目标明确的训练爬取完全不同——它直直打在你源站的记忆体、快取命中率和 egress 频宽上。你的源站感觉到的是延迟,你的帐单感觉到的是金额。
这组研究里最反直觉的一行数据是:AI 爬虫对 robots.txt 的遵守率高达 95.6%。换句话说,bot 端几乎没有「不听话」的问题——问题出在规则本身:被追踪的出版方,平均只在 robots.txt 里封锁了约 21% 的 AI 爬虫。覆盖率从 100% 到约 2% 都有,而这个差异跟技术能力完全无关,只跟「上次有人打开这个档并对照最新 user-agent 清单是几年前」有关。
一句话总结:bot 在遵守你的规则,但你的规则写在它们还不存在的时候。去年的 robots.txt 面对 2026 年的爬虫清单,等于一张过期的门禁卡。
每个 bot session 的成本都算在你头上:origin 请求、快取 miss、egress 频宽、资料库查询——而回来的价值可能是零。搜寻引擎爬虫带来排名与流量,是生意;大规模训练扫抓带走的只是你的频宽帐单。所以「要不要挡」从来不是二选一,而是逐个 bot 做决定:带来搜寻转介的放行、高流量低价值的限流或封锁、重复抓取未变更页面的优先处理。而 robots.txt 只是「礼貌请求」,对不守规矩的,还得靠 CDN/WAF 层的 rate limiting 与 WAF 规则真的挡在边缘。
最贵的 bot 流量,往往是那个你根本不知道存在的那一个。雷飞数位用 AI 24/7 分析你的日志,找出真正的频宽大户,在 WAF 边缘层自动执行放行、限流、封锁的逐 bot 策略——让你的 CDN 帐单只付你真正想招待的流量。