2026 年 7 月 1 日,Cloudflare 在 Content Independence Day 第二屆活動中,正式把過去「AI 爬蟲擋或不擋」的二元選擇,拆成三個獨立開關:Search、Agent、Training。這不是單純的命名遊戲,而是 CDN 成本與引用權的重新分配。
9 月 15 日起,針對新接入的網域、既有客戶新增的網站,以及所有免費方案客戶,只要頁面上有顯示廣告,就會預設封鎖 Training 與 Agent 類爬蟲,Search 則繼續放行。換句話說,付費方案的舊網站可維持原設定,免費方案掛廣告的小站最容易被自動改寫。
Cloudflare 指出,AI 爬蟲已佔已驗證 Bot 流量的 20.3%,加上 AI 搜尋 Bot 6.5%,約四分之一的合法 Bot 負載與 AI 有關。Training 型佔 AI 爬蟲流量近 80%,但帶回的價值最低。過去多數團隊只看到「爬蟲流量很大、很吵」,把三類一網打盡,結果是省了一點 CDN 成本,卻同時封掉了 Search 引用。
實務上 Googlebot、BingBot 等爬蟲同時做搜尋索引與訓練資料收集,是典型的「兩棲爬蟲」。Cloudflare 的處理是依所有行為以最嚴規則判定:若你選擇擋 Training,這些混合爬蟲會被一併擋掉,即使它同時也在做你想要的搜尋索引。這迫使站長必須在「擋訓練」與「保住 AI 搜尋引用」之間做出選擇。
此外,Cloudflare 也推進 Pay Per Crawl 內測,並朝 Pay Per Use 方向發展:內容被用進 AI 生成的答案才計費,而非單純抓取次數。目前公開合作夥伴僅有 Ceramic.ai 與 You.com,機制仍在早期。
9/15 之後,單純的二元阻擋已經不夠。企業需要的是能辨識爬蟲類別、意圖與商業價值的邊緣治理:讓 Search 進來、Training 擋掉、惡意流量封鎖,同時把 WAF 政策與 robots.txt 意圖自動對帳,避免無聲的引用權損失。
阻擋無效爬蟲的核心不是全封,而是分類分帳。雷飛數位的 AIOps 方案會在邊緣持續辨識 Search/Agent/Training 三類流量,讓 Search 帶回引用、Training 降低 CDN 成本、惡意 Bot 直接封鎖,同時自動對齊 WAF 與 robots.txt,避免你因為一次 429 就永久消失在 AI 搜尋答案裡。