#029
2026-08-23

WAF 正在無聲封鎖你的 AI 搜尋爬蟲:四分之三 Bot 流量來自 AI,你的引用權可能早已被誤殺

📰 想看更多新聞?
瀏覽完整新聞列表

2026 年的 CDN 與 Bot 流量版圖已經徹底改變。Cloudflare 的最新測量顯示,AI 爬蟲已佔所有「已驗證 Bot 流量」的 20.3%,再加上 AI 搜尋 Bot 的 6.5%,等於約四分之一的合法 Bot 負載都與 AI 有關。這代表你的 CDN 帳單、伺服器的 I/O 與 log 處理成本,都有一部分是被 AI 爬蟲消耗的。

但真正被多數資安團隊忽略的,不是「AI 爬蟲很多」,而是——你的 WAF 很可能正在無聲地阻擋那些讓你的服務被 AI 引用、被搜尋到的爬蟲。而這種阻擋,往往連行銷團隊都不知道。

AI 爬蟲不是「一種」,而是「三種」

把「AI 爬蟲」當成同一類來處理,是所有錯誤的起點。實際上 2026 年值得關注的 AI 爬蟲可分成三個截然不同的類別,阻擋每一類的後果完全不一樣:

Cloudflare 的數據顯示,Training 型佔了 AI 爬蟲流量的近 80%——量最大的一類,恰恰是阻擋代價最低的一類。多數資安團隊看到的是「爬蟲流量很大、很吵」,於是把最吵的 Training 型與最安靜、但最決定引用權的 Retrieval 型一網打盡。結果就是:你省了一點 CDN 成本,卻失去了 AI 搜尋的能見度。

WAF 與 robots.txt 的「無聲衝突」

更棘手的是,WAF 規則會覆蓋 robots.txt。你的 robots.txt 可能寫著「允許 OAI-SearchBot」,但如果邊緣的 WAF 規則(或某個 2022 年寫的「阻擋未知 Bot」老規則)沒有更新,爬蟲實際到達你源站的次數會是零。而你的 dashboard 上看不出來——因為被擋的請求根本不會計入成功流量。

這就是「無聲」的危險:它不出現在任何告警、任何報表裡,只是靜靜地让你的服務在某個 AI 搜尋產品的答案裡消失。要驗證,必須去翻源站 log,用爬蟲的 User-Agent token 逐一比對,才能發現 Retrieval 型爬蟲的命中數其實長期掛零。

9/15 之後,平台預設也會改變

Cloudflare 將於 2026 年 9 月 15 日起,對新接入的域名引入三類 AI 流量的獨立預設:在展示廣告的頁面上,Training 與 Agent 預設被阻擋,Search 維持允許。這代表「一筆封鎖」的二元時代正在結束,取而代之的是分類的、有意識的 Bot 政策

但這也帶來新的風險:如果你的資安團隊在 9/15 之後才開始分類管理,很可能會不小心把 Search 型也一併擋掉。真正的解法,不是「全開」或「全關」,而是讓 AI 幫你做這個分類判斷

💡 LAFA 觀點

阻擋 AI 爬蟲最貴的錯誤不是「擋太多」,而是「擋錯」——一次 429 或 403,就可能讓你的服務永久消失在某個 AI 搜尋答案裡,而且你根本不會收到任何通知。雷飛數位的 AIOps 方案會在邊緣持續辨識每種爬蟲的類別與意圖,讓 Search 進來、Training 擋掉、惡意流量封鎖,同時把「你的 WAF 政策」和「你的 robots.txt 意圖」自動對帳,避免這種無聲的引用權損失。