#020
2026-07-19

Meta AI 机器人 9 亿次请求零回馈:网站 CDN 成本被 AI 爬虫吃光怎么办?

📰 想看更多新闻?
浏览完整新闻列表

你的网站每个月花多少钱在 CDN 上?如果答案是「不少」,那么你可能正在替科技巨头买单——而且是无偿的。

资安公司 DataDome 最新报告揭示了一个让网站经营者头痛的事实:Meta 的 AI 机器人在 2026 年第二季(Q2)总共发出了 9 亿次请求,目标是爬取网站内容来训练其 AI 模型。然而这些请求不仅没有为网站带来任何推荐流量(Referral Traffic),反而消耗了大量的伺服器资源和 CDN 频宽——全部由网站经营者自行买单。

AI 爬虫:旧的内容交换协议已经崩坏

过去三十年,搜寻引擎爬虫和网站之间存在一个不成文的默契:你让我爬内容,我送你流量。Google Bot 每爬取一次网页,就有机会让该网页出现在搜寻结果中,为网站带来真实访客。这是一个互利共生的生态。

但 AI 时代打破了这个规则。AI 爬虫爬取内容的目的是训练模型——它不需要也不打算把访客导回你的网站。你付了 CDN 费用让它把内容搬走,它回馈给你的只有一张更大的帐单。TechRadar 的分析指出,这是「网站经营者从未同意的单方面掠夺」。

不是所有 AI 爬虫都一样:ChatGPT vs Meta

值得注意的是,并非所有 AI 公司的爬虫政策都相同。报告特别比较了两家代表性公司:

这说明了关键差别:有些 AI 公司愿意为内容「产生价值回馈」,而有些则只是单方面索取。

Cloudflare 的新解法:Pay Per Crawl

面对这个问题,内容传递网路(CDN)巨头 Cloudflare 在七月初推出了全面升级的 AI 流量管理方案。去年他们推出了一键「封锁 AI 机器人」功能,而今年更进一步推出了 Pay Per Crawl(按爬取付费)市集

这套机制的核心概念很直观:AI 公司想要爬取你的网站内容?可以,但每爬一次就要付费。Cloudflare 同时推出了更细致的分类管理,将自动化流量分为三大类:

网站经营者可以针对不同类型的爬虫设定不同的存取权限,甚至直接向 AI 公司收费。

9 亿次请求的背后:谁在付出代价?

DataDome 的报告进一步分析,这些 AI 爬虫流量对不同规模网站的影响差异巨大。大型平台或许有谈判筹码,但中小型网站和新创团队受到的冲击最严重

当务之急:建立有效的 AI 流量管理策略

这个问题短期内不会消失,甚至会随著更多 AI 公司进入市场而更加严重。对于网站经营者和服务提供商来说,现在就该著手建立三道防线:

第一道:辨识。 透过请求特征(User-Agent、行为模式、IP 信誉)区分哪些是 AI 爬虫流量。不是所有自动化请求都是恶意的——Google Bot 仍然值得欢迎,而 Meta 之类的训练爬虫则需要限制。

第二道:分级。 对不同类型的爬虫设定不同的速率限制(Rate Limit)。合法搜寻引擎可以保持存取,模型训练爬虫应该被限速或阻挡。

第三道:阻挡或收费。 对不产生价值的 AI 爬虫直接封锁,或透过 Cloudflare Pay Per Crawl 之类的机制收取费用。

💡 LAFA 观点
AI 爬虫流量吃掉 CDN 预算这件事,在 2026 年已经从「技术问题」升级为「财务问题」。雷飞数位的 AI 运维方案内建无效爬虫辨识与 Bot 流量管理功能——我们能在请求到达你的伺服器前就完成检查与过滤,把 Meta 这类只索取不回馈的爬虫直接挡在门外。这不只是保护你的伺服器,更是直接帮你保住每月的 CDN 预算