发布日期:2026年6月21日 | 来源:Kinsta 数据分析、ETH Zurich + Cloudflare 研究报告综合整理
根据 Kinsta 最新公开的服务器数据,一个 WordPress 购物网站在 一小时内收到 375 万次 AI 爬虫对购物车页面的请求。这些来自大型语言模型训练机器的自动化脚本,不会产生任何销售转换,但会消耗你的 CDN 带宽、触发后端处理逻辑,最终反映在你的月账单上。
这听起来很夸张吗?根据 ETH Zurich 与 Cloudflare 于 2026 年 4 月联合发表的研究,目前约有 32% 的全球网络流量是由自动化 AI 爬虫产生。而且这个比例正在持续攀升——因为 2026 年正是「Agentic AI」爆发的一年。
多数企业以为用了 Cloudflare、AWS WAF 或 Akamai 就能挡住垃圾流量,但研究揭露了更深层的问题:AI 爬虫正在从根本上绕过传统 CDN 缓存机制。
| 攻击方式 | 传统 CDN 缓存保护 | AI 爬虫的破解方式 |
|---|---|---|
| 请求模式 | 固定 URL + 随机 UA | 每个请求使用不同 UA + JavaScript 渲染内容后再请求 |
| 缓存破坏 | —— | 主动注入缓存破坏参数,迫使每次请求都回到 origin server |
| 速率限制 | IP 级别限流 | 分散数千个 IP 协议池,每个 IP 请求量都在阈值以下 |
| 费用影响 | —— | 企业为「假流量」支付 15-40% 的 CDN 额外成本 |
面对这个问题,主流 CDN 供应商纷纷推出新方案:
问题在于:大多数中小企业根本没有资源设定这些复杂规则。你不需要自己写 Cloudflare worker、不需要研究每个 crawler fingerprint、更不希望半夜被 CDN 账单吓醒。
这是最讽刺的地方:你付钱给 CDN 供应商,让他们把流量送到你的服务器;然后这些流量不是来买东西的人类,而是来「读」你网站的 AI 模型。AI 公司从中获利(获得训练资料、SEO 排名),而你付出基础设施成本却得不到任何回报。
Kinsta 的研究显示,单一 WordPress 站点的无效爬虫流量可高达总流量的 35%。换句话说:你每付 $100 的 CDN 费用,大约有 $35 是花在替别人做嫁衣裳。