距离 2026 年 9 月 15 日只剩不到两周,网际网路的「爬虫经济」即将迎来一个转折点。从 9 月 15 日起,Cloudflare 将对新进网域预设封锁训练型与代理型(Agent)的 AI 爬虫,且优先限制「显示广告的页面」,只有搜寻型爬虫(Search)得以放行。这不仅是单一厂商的规则调整,更预示著整个产业正从「允许或拒绝」的简单二元选择,转向「按流量付费、按授权收费」的市场化阶段。
为什么这个时间点特别关键?因为过去网站主在面对 AI 爬虫时,最依赖的防御工具其实是最脆弱的——robots.txt。一份针对超过一万个网域的 2026 年 7 月分析指出,高达 39.5% 的网域在 robots.txt 中设定的 GPTBot 封锁规则,并未在网路层真正被遵守。换句话说,超过每三个网站就有一个,以为自己已经拒绝了 AI 爬虫,实际上仍被大量抓取。
robots.txt 的本质是「请求式」(opt-in)的礼貌协议,它依赖两个前提:爬虫愿意遵守档案内容,以及它能诚实地表明自己身分。而这两件事在 AI 时代都无法保证。现代爬虫可以轻易伪装身分、模拟人类浏览器行为,甚至透过 IP 范围与反向 DNS 来规避验证。
产业的回应正在两种方向同时推进。其一,是 Cloudflare 提出的「按次付费爬取」(pay-per-crawl)模型——出版者可以直接向 AI 公司收取存取费用,把原本只能被消耗的成本,变成可以赚取的营收。其二,是授权协议(licensing)的兴起:大型 AI 训练机构愿意为高品质内容付费,网站主只需在后台勾选即可决定是否授权。
对多数中小网站而言,这两种机制意味著一个现实:你不需要成为大型科技巨头,也能从「被爬取」这件事中获得可衡量的经济利益,只要你能明确地「让谁能抓、让谁不能抓」。
除了直接的 CDN 流量,无效爬虫对伺服器的消耗更隐性、也更难以排除。大量请求会占用 CPU、记忆体与连线资源,拖慢真实使用者的体验,甚至成为拒绝服务的前奏。这正是为什么越来越多的网站主开始在「边缘层」部署智能阻挡——在流量抵达后端服务之前,就先判定其来源并处理。
判断的难度高在「该挡的挡、该留的留」。有些 AI 流量是有害的(纯粹消耗资源、进行训练或恶意扫描),有些则是有价值的(带来引用流量、未来可能转化为客户)。2026 年的实践正在教我们,这不是一刀切的问题,而是需要持续侦测、评估「抓取与引用比例」的动态决策。
对拥有大量内容或流量成本的网站来说,人工监控爬虫行为既不现实,也跟不上规则的演进速度。这正是 AI 运维的核心价值所在——24/7 自动侦测异常流量、即时调整防御规则、秒级回应攻击模式。无论 Cloudflare、WAF 还是自建边缘规则,都能透过自动化的运维体系,让「阻挡无效流量」从一次性的设定,变成持续运作的防护网。
当 9/15 之后阻挡 AI 爬虫变成预设动作,真正的战场就从「要不要挡」转为「挡得准不准、快不快」。雷飞数位的 AI 运维顾问服务正是为这个时刻而生——自动侦测高消耗爬虫、即时调整 WAF 与边缘规则、以 AI 秒级回应流量异常,在成本膨胀之前先把它挡下来。无效流量挡得住,CDN 帐单才挡得住。