#035
2026-09-11

63% 的 AI 爬蟲流量只來自這兩個:AmazonBot 與 Meta 正在吃掉你的 CDN 頻寬

📰 想看更多新聞?
瀏覽完整新聞列表

51Degrees 最近發布了一份基於30 億次真實網站訪問(截至 2026 年 5 月 29 日的一年)的 AI bot 流量研究,涵蓋電信、媒體、零售、金流、科技等行業。三個數字值得所有付 CDN 帳單的人看一眼:AI bot 流量年增 62.5%、已佔全部 web sessions 的 13%(去年還只有 8%)、而在 72 個被辨識出的 AI 相關爬蟲裡,AmazonBot 與 Meta-External-Agent 兩家就佔了 63% 的流量

真正吃掉頻寬的,不是頭條上的那幾個名字

過去一年,媒體與社群討論的 AI 爬蟲幾乎清一色是 GPTBot、CCBot、ClaudeBot——它們上了頭條、上了法庭。但 51Degrees 的數據完全不是這麼回事:單日 AmazonBot 就有 643 萬次 session、佔全站流量的 4% 以上;Meta-External-Agent 約 423 萬次、佔 3%。而大家討論最多的 ClaudeBot 單日只有約 28.8 萬次,排在第七名;OpenAI Search Bot 約 12.9 萬次,排第九。前四大爬蟲(AmazonBot、Meta、AhrefsBot、BingBot)就吃掉了全部爬蟲 session 的 85%。

更關鍵的是「負載形態」不同。Known Agents 把 AmazonBot 描述成「廣度極高的大規模掃抓,每次訪問抓取的頁面遠多於一般搜尋爬蟲」。這種 load profile 跟目標明確的訓練爬取完全不同——它直直打在你源站的記憶體、快取命中率和 egress 頻寬上。你的源站感覺到的是延遲,你的帳單感覺到的是金額。

真正的問題:bot 都守規矩,是沒人寫規則

這組研究裡最反直覺的一行數據是:AI 爬蟲對 robots.txt 的遵守率高達 95.6%。換句話說,bot 端幾乎沒有「不聽話」的問題——問題出在規則本身:被追蹤的出版方,平均只在 robots.txt 裡封鎖了約 21% 的 AI 爬蟲。覆蓋率從 100% 到約 2% 都有,而這個差異跟技術能力完全無關,只跟「上次有人打開這個檔並對照最新 user-agent 清單是幾年前」有關。

一句話總結:bot 在遵守你的規則,但你的規則寫在它們還不存在的時候。去年的 robots.txt 面對 2026 年的爬蟲清單,等於一張過期的門禁卡。

每一次「招待」都有真實成本

每個 bot session 的成本都算在你頭上:origin 請求、快取 miss、egress 頻寬、資料庫查詢——而回來的價值可能是零。搜尋引擎爬蟲帶來排名與流量,是生意;大規模訓練掃抓帶走的只是你的頻寬帳單。所以「要不要擋」從來不是二選一,而是逐個 bot 做決定:帶來搜尋轉介的放行、高流量低價值的限流或封鎖、重複抓取未變更頁面的優先處理。而 robots.txt 只是「禮貌請求」,對不守規矩的,還得靠 CDN/WAF 層的 rate limiting 與 WAF 規則真的擋在邊緣。

這週可以做的三件事

💡 LAFA 觀點

最貴的 bot 流量,往往是那個你根本不知道存在的那一個。雷飛數位用 AI 24/7 分析你的日誌,找出真正的頻寬大戶,在 WAF 邊緣層自動執行放行、限流、封鎖的逐 bot 策略——讓你的 CDN 帳單只付你真正想招待的流量。