你的网站每个月花多少钱在 CDN 上?如果答案是「不少」,那么你可能正在替科技巨头买单——而且是无偿的。
资安公司 DataDome 最新报告揭示了一个让网站经营者头痛的事实:Meta 的 AI 机器人在 2026 年第二季(Q2)总共发出了 9 亿次请求,目标是爬取网站内容来训练其 AI 模型。然而这些请求不仅没有为网站带来任何推荐流量(Referral Traffic),反而消耗了大量的伺服器资源和 CDN 频宽——全部由网站经营者自行买单。
过去三十年,搜寻引擎爬虫和网站之间存在一个不成文的默契:你让我爬内容,我送你流量。Google Bot 每爬取一次网页,就有机会让该网页出现在搜寻结果中,为网站带来真实访客。这是一个互利共生的生态。
但 AI 时代打破了这个规则。AI 爬虫爬取内容的目的是训练模型——它不需要也不打算把访客导回你的网站。你付了 CDN 费用让它把内容搬走,它回馈给你的只有一张更大的帐单。TechRadar 的分析指出,这是「网站经营者从未同意的单方面掠夺」。
值得注意的是,并非所有 AI 公司的爬虫政策都相同。报告特别比较了两家代表性公司:
这说明了关键差别:有些 AI 公司愿意为内容「产生价值回馈」,而有些则只是单方面索取。
面对这个问题,内容传递网路(CDN)巨头 Cloudflare 在七月初推出了全面升级的 AI 流量管理方案。去年他们推出了一键「封锁 AI 机器人」功能,而今年更进一步推出了 Pay Per Crawl(按爬取付费)市集。
这套机制的核心概念很直观:AI 公司想要爬取你的网站内容?可以,但每爬一次就要付费。Cloudflare 同时推出了更细致的分类管理,将自动化流量分为三大类:
网站经营者可以针对不同类型的爬虫设定不同的存取权限,甚至直接向 AI 公司收费。
DataDome 的报告进一步分析,这些 AI 爬虫流量对不同规模网站的影响差异巨大。大型平台或许有谈判筹码,但中小型网站和新创团队受到的冲击最严重:
这个问题短期内不会消失,甚至会随著更多 AI 公司进入市场而更加严重。对于网站经营者和服务提供商来说,现在就该著手建立三道防线:
第一道:辨识。 透过请求特征(User-Agent、行为模式、IP 信誉)区分哪些是 AI 爬虫流量。不是所有自动化请求都是恶意的——Google Bot 仍然值得欢迎,而 Meta 之类的训练爬虫则需要限制。
第二道:分级。 对不同类型的爬虫设定不同的速率限制(Rate Limit)。合法搜寻引擎可以保持存取,模型训练爬虫应该被限速或阻挡。
第三道:阻挡或收费。 对不产生价值的 AI 爬虫直接封锁,或透过 Cloudflare Pay Per Crawl 之类的机制收取费用。