如果你以為robots.txt 還能完全控制誰可以爬你的網站,那現在可能該重新思考了。Cloudflare 最新的研究數據揭示了一個令人不安的事實:2026 年 5 月,AI 相關的爬蟲已經佔據驗證 Bot 流量的 20.3%,如果再加上 AI 搜尋類型的爬蟲,比例達到 四分之一。這意味著每四封來自機器人的請求中,就有一封跟 AI 有關。
更關鍵的發現是——不是所有 AI 爬蟲都一樣。把它們統統一封鎖,可能會讓你付出比想像中更大的代價。
過去我們習慣把 Bot 流量當成一个整體來看待——不是真人就是機器人,擋掉就對了。但 Cloudflare 的研究指出,AI 爬蟲實際上應該分為三個截然不同的類別,而封鎖它們的後果完全不同:
GPTBot、ClaudeBot、Google-Extended 屬於這一類。它們收集你的網站內容,可能最終被用於訓練大型語言模型的參數。封鎖它不會讓任何人無法看到你的網頁——只是你的內容不會成為 AI 模型的「知識庫」的一部分。對大多數企業來說,短期影響幾乎為零。
OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot 在這裡。這才是你需要小心的地方。這些爬蟲建立的是 AI 搜尋引擎的即時索引——當有人在 ChatGPT 或 Claude 中搜尋你的行業相關問題時,如果它們沒有抓到你的頁面,你就會從回答的引用來源中完全消失。封鎖檢索型爬蟲 = 主動退出 AI 搜尋結果。
ChatGPT-User、Claude-User、Perplexity-User。這類請求發生在「真人」主動要求 AI 讀取你的特定頁面時——比如一個潛在客戶問 ChatGPT「幫我看看 Lafa System 的資安防護方案怎麼說」。如果你封鎖了這些爬蟲,等於在潜在客户做研究的時候直接拒絕他們。
Cloudflare 第一季度統計顯示,GPTBot 是被 robots.txt 封鎖最頻繁的 AI 爬蟲,出現在 5.52% 的 DISALLOW 規則中,緊隨其後的是 CCBot(5.08%)和 ClaudeBot(4.88%)。但研究同時發現,大約 80% 的 AI 爬蟲流量來自訓練型——也就是說,大部分被封鎖的其實是不會造成直接損失的那一類。
真正危險的是:很多資安團隊在設定 WAF 或 CDN 規則時,根本沒有區分這三類。一條簡單的「阻擋所有非 Google 搜尋引擎爬蟲」的規則,可能同時殺死了你的品牌在 ChatGPT、Perplexity 和 Claude 中的可見度。
robots.txt 的問題一直存在——它只是一份「禮貌請求」,無法真正阻止不遵守規則的爬蟲。但到了 AI 時代,這個問題變得更加突出:
Cloudflare 宣佈在 2026 年 9 月 15 日,新註冊的網域將預設封鎖「訓練型」和「Agent 型」AI 爬蟲在顯示廣告的頁面上,但搜尋類型的爬蟲保持允許。這個方向很明確:把「可被搜尋到」和「被拿去訓練模型」分開管理。
對內容出版商來說,這或許是好事——你的文章可以被引用但不被訓練。但對 B2B 服務商而言,如果 ChatGPT 無法即時讀取你的方案頁面,潛在客戶的轉換漏斗就斷了。
AI 爬蟲產生大量無效流量,消耗的是你的 CDN 頻寬和請求配額。根據 Cloudflare 的數據,驗證 Bot 流量的四分之一來自 AI——這意味著如果你的網站每月被 Bot 消耗了 10 萬次請求,其中約 25,000 次就來自 AI 爬蟲。這些請求不會轉化成客戶,但會真實地增加你的 CDN 成本。
問題是:大多數中小企業沒有資源區分「有價值的爬蟲流量」和「純消耗成本的爬蟲流量」。他們只看到帳單上的數字在增長,卻不知道怎麼精細過濾——結果要麼全擋(失去搜尋能見度),要麼全開(白付 CDN 費用)。
Cloudflare 已經推出了「pay-per-crawl」模型,讓出版商可以對 AI 公司的抓取行為收費。這意味著未來的規則不再只是「允許或禁止」,而是走向「授權与計價」的新階段。對於需要被 AI 搜尋索引但同時要控制成本的企業來說,這或許是唯一平衡的解決方案。
AI 爬蟲流量已佔四分之一 Bot 請求,靠 robots.txt 手動管理根本來不及。Lafa System 的 AI 自動運維能在 CDN 層即時識別三類 AI 爬蟲、智能調整過濾規則——保留檢索型爬蟲維持搜尋能見度,同時精確封鎖消耗成本的訓練型爬蟲,讓你的 CDN 費用真正花在值得的地方。