#021
2026-07-26

AWS WAF 正式跟进 HTTP 402 付费爬取:你的网站该向 AI 机器人收费吗?

📰 想看更多新闻?
浏览完整新闻列表

1997 年,IETF 在 HTTP 规范中写下了一个状态码:402 Payment Required(需要付款)。它被设计为一个"保留位"——技术上存在,但几乎没人真正使用。整整近三十年后,这个沉睡的状态码突然成为全球网络基础设施中最热门的话题之一。

原因很简单:AI 爬虫正在吞噬网站经营者的资源与钱包,而 HTTP 402 是目前唯一能让机器与机器之间进行"付费通行"协议的方式。更值得注意的是,这次带头的不是某个初创公司,而是CloudflareAWS这两大云端基础设施巨头。

当 WAF 从防火墙变成收费站

2025 年 7 月,Cloudflare 率先推出 Pay Per Crawl(按爬取付费)功能。网站拥有者可以在后台设定每页的单价,当 AI 机器人请求内容时,必须在请求头中附上付款意图,否则就会收到 HTTP 402 回应并被拒之门外。

到了 2026 年 6 月 15 日,AWS 跟进了同一套机制——将其整合进 WAF Bot Control 系统。AWS 的实现方式更加细致:定价可以依内容路径和机器人类型分别设定,甚至不需要修改网站代码。付款则透过 Coinbase 基础设施以稳定币完成结算。

两套系统的共通点很明确:收费机制被放在 CDN/WAF 边缘层——也就是原本就负责"决定谁可以进"的那一层。这意味着防火墙与计费系统正式合而为一,以往凭默认允许所有流量通过的时代已经结束。

不只是钱的问题:能见度贸易

表面上看,HTTP 402 是一套"向 AI 公司收租"的方案。但深入分析后会发现,真正的问题不是收入而是能见度

过去的三十年里,搜索引擎爬虫和网站之间存在一个默契:你让我爬内容,我带访客来。Google Bot 每索引一次你的页面,就可能让该页面出现在搜索结果中,为你的网站带来真实流量。这是一个双赢的循环。

AI 时代打破了这个规则。AI 爬虫的爬取目的不再是建立"可点击的索引",而是提取内容用于模型训练——它搬走你的资料,但很少把读者导回你的网站。Cloudflare 的分析指出,AI 爬虫活动中约 80% 是为了模型训练,真正能产生推荐流量的搜索型请求只占极小比例。

因此 HTTP 402 的本质是:让网站拥有者重新决定"谁值得免费看到我的内容"。你选择向哪个爬虫收费、放行哪些机器人,其实就是在决定了你的品牌会出现在哪些 AI 回答中。

不同身份的人,答案完全不同

"该不该对 AI 爬虫收费?"这个问题并没有唯一答案。关键在于你拥有的内容形态和你的分发策略:

底层的技术基础:x402 开放标准

Cloudflare 与 AWS 的 HTTP 402 机制都建立在同一个底层协议上——x402,这是 Coinbase 主导开发的开放标准。它使用稳定币完成机器间支付,不要求付款方拥有账户或完成 KYC。这代表收费站的范围可以从知名的 AI 爬虫延伸到匿名机器人

此外还有 TollBit、Akamai、Skyfire 等第三方方案正在进入这个市场。所有这些方案的共同趋势是:存取控制与计费在同一个边缘规则引擎中完成。你不再需要一套 WAF 防火墙加上一套独立计费系统——它们已经合并了。

对运维团队的实际影响

无论你是否决定向 AI 爬虫收费,HTTP 402 的出现都代表一个现实:你的 WAF/CDN 边缘层现在是你控制 Bot 流量的唯一前线。这意味着每个运维团队都需要做到以下几件事:

第一,看清谁在爬你。 透过 Bot 分析工具了解哪些是搜索引擎(值得欢迎)、哪些是 AI 代理(可能有价值)、哪些是纯训练爬虫(只索取不回馈)。看不见就管不了。

第二,建立分级策略。 对不同类形的 Bot 设定不同的存取规则——合法搜索引擎全开、AI 代理限速、训练爬虫直接阻挡或收费。

第三,自动化执行。 靠人工监控和手动封锁已经不够。你需要的是能在请求抵达服务器之前就完成辨识与决策的自动化防御体系。

💡 LAFA 观点
HTTP 402 Pay Per Crawl 的出现是一个重要的里程碑——它证明了"在边缘层管理 Bot 流量"已经从选配变为必修。雷飞数位的 AI 运维方案内建 Bot 分类、速率限制与自动阻挡机制,不需要你成为付费爬取的专家,我们就能在请求到达你的基础设施前完成过滤与决策。无论是"想收费"还是"想封锁",我们都帮你处理在最前面