robots.txtがあれば自分のサイトを誰がクロールできるかを完全に制御できると考えているなら、考え直すべきかもしれません。Cloudflareの最新の研究データは驚くべき事実を明らかにしています。2026年5月現在、AI関連のクローラは検証済みボットトラフィックの20.3%を占め、AI検索型のクローラを加えるとその割合は4分の1に達します。つまり、ロボットからのリクエスト4回に1回はAIに関係しているのです。
さらに重要な発見があります—すべてのAIクローラが同じではないということです。それらを一律にブロックすることは、思っているよりもはるかに大きな代償を払うことになる可能性があります。
過去にはボットトラフィックを一つの塊として扱い—人間かロボットか、ロボットならブロックすればよい—と考えていました。しかしCloudflareの研究は、AIクローラは実際に3つの明確に異なる分類に分かれ、それぞれをブロックする結果が全く違うことを指摘しています。
GPTBot、ClaudeBot、Google-Extended がこれに該当します。これらはあなたのサイトの内容を集め、最終的に大規模言語モデルの重みを訓練するために使用される可能性があります。これらをブロックしても誰かがあなたのページを見られなくなるわけではありません—ただあなたのコンテンツがAIモデルの「知識ベース」に含まれなくなるだけです。ほとんどの企業にとって短期的な影響はほぼゼロです。
OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot がこれに該当します。ここが気をつけるべきポイントです。これらのクローラは、AI検索エンジンが回答を生成する際に参照するリアルタイムインデックスを作成します。あなたのページを取得しないと、ChatGPTやClaudeの引用回答から完全に消えてしまいます。検索型クローラをブロックすることは=AI検索結果から自ら姿を消すことです。
ChatGPT-User、Claude-User、Perplexity-User。これらのリクエストは「本物の人間」がAIにあなたの特定のページを読んでほしいと明示的に要求したときに発生します—例えば、見込み客が ChatGPT に「Lafa Systemのセキュリティソリューションを調べて」依頼する場合です。これらのクローラをブロックすると、潜在的な顧客があなたを研究中に実際に拒否することになります。
Cloudflareの第1四半期の統計によると、GPTBot が robots.txt によって最も頻繁にブロックされているAIクローラで、DISALLOW ルールの 5.52% に登場し、次に CCBot(5.08%)、ClaudeBot(4.88%)が続きます。しかし研究はさらに、AIクローラトラフィックの約80%がトレーニング型ボットから来ていることも示しています—つまり、最もブロックされているのは実は直接的な害を最小限のカテゴリなのです。
真の危険性は:WAF や CDN ルールを設定している多くのセキュリティチームがこの3つの分類を区別していません。単純な「Google 以外の検索エンジンクローラをすべてブロック」ルールが、同時に ChatGPT、Perplexity、Claude でのブランドの可視性を破壊してしまう可能性があります。
robots.txtの問題は昔からありました—それは本質的に「丁寧な要望」であり、強制力のある仕組みではありません。しかしAI時代において、この弱さがより重要な影響を及ぼしています。
Cloudflareは2026年9月15日以降、新規登録ドメインで広告表示ページ上の「トレーニング型」と「エージェント型」AIクローラのブロックをデフォルトにする予定ですが、検索型のクローラは許可されたままとなります。方向性は明確です:「検索での発見可能性」と「モデル訓練への使用」を分離管理するということです。
コンテンツ出版社にとっては良いかもしれません—記事が引用されながら訓練データには含まれない。しかしB2Bサービスプロバイダにとって、ChatGPT がリアルタイムであなたのソリューションページを読み取れなければ、リード変換の漏斗は壊れます。
AIクローラは大量の有効でないトラフィックを生成し、CDN帯域幅とリクエスト割当を消費します。Cloudflare のデータによると、サイトが月間10万回のボットリクエストを受けるとすると、そのうち約25,000回はAIクローラから来ています。これらのリクエストは決して顧客にはなりませんが、CDN請求書を増加させるのは事実です。
問題なのは:大多数の中小企業が「価値のあるクローラトラフィック」と「純粋なコスト削減トラフィック」を区別する余裕がないことです。彼らは請求書の数字が上昇することしか見えませんが、精密にフィルタリングする方法がない—結果としてすべてをブロックするか(検索可視性を失う)、すべてを許可するか(CDN料金を無駄にする)の二択になります。
Cloudflare はすでに「pay-per-crawl」モデルを発表しており、出版社がAI企業にアクセス料を請求できるようにしています。つまり未来は「許可か禁止か」だけではないで、「ライセンスと価格設定」の新たな段階へと移行しているのです。コストを抑えながら AI 検索で索引されたい企業にとって、これは唯一のバランスの取れた解決策となるかもしれません。
AIクローラトラフィックがボットリクエストの4分の1を占めるようになり、robots.txt で管理することはもはや非現実的です。Lafa System の AI 自動運用は CDN レベルで3つのクローラ分類をリアルタイムで識別し、フィルタリングルールをインテリジェントに調整します—検索可視性を維持するために検索型クローラを残しつつ、CDN予算だけを消費するトレーニング型クローラを精密にブロックし、インフラコストの1円1銭が実質的に稼働するようにします。