#022
2026-07-29

Cloudflare 9/15 爬蟲三類分流正式啟用:搜尋引擎、AI Agent、訓練爬蟲終於被拆開管理

📰 想看更多新聞?
瀏覽完整新聞列表

過去幾年中,網站擁有者面對 AI 爬蟲只有一個粗糙的工具:把所有 Bot 擋掉、或者全部放行。這個非黑即白的控制方式在 2026 年 7 月 終於出現了實質性改變。

Cloudflare 於今年 7 月 1 日為所有客戶(包含免費版)開放了三組獨立的 AI 流量開關:Search(搜尋引擎爬蟲)、Agent(即時 AI 代理)、Training(模型訓練爬蟲)。到了 9 月 15 日,預設值將正式翻轉——任何顯示廣告的頁面,會自動阻擋 Training 和 Agent 類型的 Bot。

從「一刀切」到「分級管理」:為什麼這很重要?

在舊世界中,網站擁有者只能靠 robots.txt 表達意願,但多數 AI 爬蟲根本不會遵守。Googlebot 同時為搜尋索引和 Gemini 訓練抓取內容;Anthropic 的 ClaudeBot 每爬取超過 11,000 頁 才產生一次推薦流量(Cloudflare Radar 2026 年中數據);OpenAI 的比例也不樂觀,約 857:1。

對比之下,傳統 Googlebot 每爬取 5 頁就能帶來 1 次點擊。這就意味著:你為 AI 訓練公司免費運行了大量伺服器資源,但幾乎沒有換回任何實際訪客。而這些無效流量正在直接消耗你的 CDN 頻寬與計費額度。

Cloudflare 的三類分流首次讓網站擁有者能對「有價值的搜尋引擎」和「只索取不回饋的訓練爬蟲」分別下達指令,而不是被迫在「全開」或「全關」之間做選擇。

最大爭議:Googlebot 也會被擋

這項政策最引發討論的部分不在於阻擋 Training Bot,而在於 Googlebot 被歸類為「多用途爬蟲」——因為 Google 使用同一套爬蟲基礎設施同時執行搜尋索引和 Gemini 模型訓練。因此,如果你選擇阻擋 Training 流量,Googlebot 在廣告頁面上也會被一併阻擋。

Hacker News 上的討論非常激烈。許多開發者認為這正是 Google 應該面對的後果:「當 OpenAI 已經把 GPTBot、OAI-SearchBot、ChatGPT-User 拆成三個獨立身份的時候,Google 還在用同一個爬蟲同時做搜尋和訓練,問題顯而易見。」

Cloudflare 也提供了退讓選項——在安全性設定中可以對「Training+Search」混合型爬蟲設定白名單。但這個選擇本身就反映了更深的產業矛盾:網站擁有者為了留住 Google 搜尋流量,可能被迫繼續免費供應訓練資料

不同規模的網站,策略完全不同

「我該怎麼設定這三組開關?」的答案取決於你的收入模式和流量來源:

robots.txt 已經不夠了

IETF 近來推動了 robots.txt 的「Content Signal」延伸協議(search=yes,ai-train=no,use=reference),但這類宣告式語法只對自願遵守的公司有效。Cloudflare 的控制面板設定才是真正在邊緣層強制執行的防火牆規則。

實務上,最有效的做法是兩套並行:robots.txt 表達你的偏好意圖,讓合規的爬蟲自動遵守;Cloudflare 控制面板則是底線防護,擋掉所有不聽話的流量。這也正好對應 WAF 運維的核心邏輯——宣告式政策加上強制性執行層

對運維團隊的實際影響

無論你的網站屬於哪一類型,Cloudflare 這次改版都指向同一個結論:Bot 流量管理已經不是「要不要做」的問題,而是「怎麼做才不會害自己」

第一,你必須知道自己被誰爬了什麼。 如果你的日誌分析工具還只分得出人類和 Bot,那你根本看不出 ClaudeBot 一天吃了你多少 GigaByte、哪些 Agent 在合法存取、哪些是在濫用。看不見就管不了,這是一切自動化防禦的前提。

第二,你需要邊緣層的快速決策能力。 等爬蟲請求到達後端伺服器再判斷已經太晚——資料流量費用是按請求次數和頻寬計費的,不是按「這個 Bot 有沒有價值」來算。你的防禦必須在 CDN/WAF 邊緣就完成分類與阻擋。

第三,設定之後不能就不管。 爬蟲的行為會變(Googlebot 可能哪天就拆成兩個獨立 UA)、新的 Bot 會出現、你的網站用途也可能改變。好的 Bot 管理策略需要定期審視和調整,而不是「設定一次就結束」。

💡 LAFA 觀點
Cloudflare 三類分流政策的出現,代表 Bot 流量管理正式進入「精細化」時代。雷飛數位的 AI 運維方案內建即時 Bot 分類、自動阻擋與速率限制,能根據爬蟲行為模式(而非僅靠 User-Agent)在請求到達前就完成識別與決策。不管你是想保護 CDN 預算還是守住資料產權,我們都幫你擋在最前面。