打开主机控台,一切看似正常:uptime 稳定、页面载入快速、这几周什么都没改。但频宽使用量就是在一格一格往上爬,PHP worker 比以前忙,下个月帐单里多了一行「超额费用」。你没涨流量,是谁在吃你的伺服器?答案越来越可能不是你的客户,而是 AI 爬虫——而且它们现在大概就在抓你的网站。
这不是危言耸听。Cloudflare 在 2026 年 8 月的数据显示,目前少于半数的 HTML 页面请求来自人类;Imperva 的年度 Bad Bot 报告也指出,自动化流量已占全部网路活动的 51%,其中「坏爬虫」就占 37%。更夸张的是增速:TollBit 对出版者网路的追踪显示,AI 爬虫与人类访客的比例,从 2025 年初的 1:200 快速恶化到第四季 1:31——一年内翻了 6.5 倍。你的网站,只是这场流量洪水中的一滴水。
一般机器人最多打扰一下你的快取,AI 训练爬虫却是实打实地逼伺服器做「无偿劳动」。它们的行为模式特别要命:
主机面板显示频宽、磁碟、CPU,却不告诉你「谁在消耗」。周二下午频宽突然飙高,那是行销活动带来真实客户,还是 ClaudeBot 把整个商品目录抓了一遍?没有 bot 层级的可视化,你分不清楚——也修不好。很多网站主于是误判成「网站长大了」升级主机方案,结果只是替一批从未邀请的爬虫付钱。
阻挡 AI 爬虫最关键的观念:让它在碰到你的伺服器之前就被挡下。bot 一旦抵达 origin,PHP 已经跑完、查询已经跑完、频宽已经烧完——此时用 WordPress 外挂或 .htaccess 挡,等于门被踹开之后才想到装锁。正确的顺序是在 CDN / WAF 边缘层识别并阻断,请求死在边缘节点,origin 连存在过都不知道,成本一分都不花。
robots.txt 呢?它只是第一道礼貌性的提醒——GPTBot、ClaudeBot 这类「讲规矩」的爬虫大多会遵守,但仿冒者与无良抓虫照样无视。真正的防御必须落在网路层;而「挡哪些、留哪些」也有讲究:纯训练爬虫拿走内容、一分回馈都没有,该挡;能带来引用流量的 AI 搜寻爬虫(OAI-SearchBot、PerplexityBot)则值得放过。
当超过一半的流量都不是人,帐单膨胀就不是意外而是必然。雷飞数位的 AI 运维服务在边缘层 24/7 自动侦测与阻挡无效爬虫流量,该挡的秒级挡下、该留的保留引用价值,让你付出去的 CDN 与伺服器费用,真正花在真实客户身上。