打開主機控台,一切看似正常:uptime 穩定、頁面載入快速、這幾週什麼都沒改。但頻寬使用量就是在一格一格往上爬,PHP worker 比以前忙,下個月帳單裡多了一行「超額費用」。你沒漲流量,是誰在吃你的伺服器?答案越來越可能不是你的客戶,而是 AI 爬蟲——而且它們現在大概就在抓你的網站。
這不是危言聳聽。Cloudflare 在 2026 年 8 月的數據顯示,目前少於半數的 HTML 頁面請求來自人類;Imperva 的年度 Bad Bot 報告也指出,自動化流量已佔全部網路活動的 51%,其中「壞爬蟲」就占 37%。更誇張的是增速:TollBit 對出版者網路的追蹤顯示,AI 爬蟲與人類訪客的比例,從 2025 年初的 1:200 快速惡化到第四季 1:31——一年內翻了 6.5 倍。你的網站,只是這場流量洪水中的一滴水。
一般機器人最多打擾一下你的快取,AI 訓練爬蟲卻是實打實地逼伺服器做「無償勞動」。它们的行為模式特別要命:
主機面板顯示頻寬、磁碟、CPU,卻不告訴你「誰在消耗」。週二下午頻寬突然飆高,那是行銷活動帶來真實客戶,還是 ClaudeBot 把整個商品目錄抓了一遍?沒有 bot 層級的可視化,你分不清楚——也修不好。很多網站主於是誤判成「網站長大了」升級主機方案,結果只是替一批從未邀請的爬蟲付錢。
阻擋 AI 爬蟲最關鍵的觀念:讓它在碰到你的伺服器之前就被擋下。bot 一旦抵達 origin,PHP 已經跑完、查詢已經跑完、頻寬已經燒完——此時用 WordPress 外掛或 .htaccess 擋,等於門被踹開之後才想到裝鎖。正確的順序是在 CDN / WAF 邊緣層識別並阻斷,請求死在邊緣節點,origin 連存在過都不知道,成本一分都不花。
robots.txt 呢?它只是第一道禮貌性的提醒——GPTBot、ClaudeBot 這類「講規矩」的爬蟲大多會遵守,但仿冒者與無良抓蟲照樣無視。真正的防禦必須落在網路層;而「擋哪些、留哪些」也有講究:純訓練爬蟲拿走內容、一分回饋都沒有,該擋;能帶來引用流量的 AI 搜尋爬蟲(OAI-SearchBot、PerplexityBot)則值得放過。
當超過一半的流量都不是人,帳單膨脹就不是意外而是必然。雷飛數位的 AI 運維服務在邊緣層 24/7 自動偵測與阻擋無效爬蟲流量,該擋的秒級擋下、該留的保留引用價值,讓你付出去的 CDN 與伺服器費用,真正花在真實客戶身上。