#024
2026-08-05

AIクローラ3分類時代の到来:Cloudflare、Botトラフィックの25%がAIと明らかに、robots.txtだけではもはや不十分

📰 さらに多くのニュース?
ニュース一覧を見る

robots.txtがあれば自分のサイトを誰がクロールできるかを完全に制御できると考えているなら、考え直すべきかもしれません。Cloudflareの最新の研究データは驚くべき事実を明らかにしています。2026年5月現在、AI関連のクローラは検証済みボットトラフィックの20.3%を占め、AI検索型のクローラを加えるとその割合は4分の1に達します。つまり、ロボットからのリクエスト4回に1回はAIに関係しているのです。

さらに重要な発見があります—すべてのAIクローラが同じではないということです。それらを一律にブロックすることは、思っているよりもはるかに大きな代償を払うことになる可能性があります。

なぜ「一括処理」ではAIクローラに対応できないのか?

過去にはボットトラフィックを一つの塊として扱い—人間かロボットか、ロボットならブロックすればよい—と考えていました。しかしCloudflareの研究は、AIクローラは実際に3つの明確に異なる分類に分かれ、それぞれをブロックする結果が全く違うことを指摘しています。

1. トレーニング型クローラ

GPTBot、ClaudeBot、Google-Extended がこれに該当します。これらはあなたのサイトの内容を集め、最終的に大規模言語モデルの重みを訓練するために使用される可能性があります。これらをブロックしても誰かがあなたのページを見られなくなるわけではありません—ただあなたのコンテンツがAIモデルの「知識ベース」に含まれなくなるだけです。ほとんどの企業にとって短期的な影響はほぼゼロです。

2. 検索型クローラ

OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot がこれに該当します。ここが気をつけるべきポイントです。これらのクローラは、AI検索エンジンが回答を生成する際に参照するリアルタイムインデックスを作成します。あなたのページを取得しないと、ChatGPTやClaudeの引用回答から完全に消えてしまいます。検索型クローラをブロックすることは=AI検索結果から自ら姿を消すことです。

3. ユーザー起動型クローラ

ChatGPT-User、Claude-User、Perplexity-User。これらのリクエストは「本物の人間」がAIにあなたの特定のページを読んでほしいと明示的に要求したときに発生します—例えば、見込み客が ChatGPT に「Lafa Systemのセキュリティソリューションを調べて」依頼する場合です。これらのクローラをブロックすると、潜在的な顧客があなたを研究中に実際に拒否することになります

データが語る事実:誰が一番ブロックされているのか?

Cloudflareの第1四半期の統計によると、GPTBot が robots.txt によって最も頻繁にブロックされているAIクローラで、DISALLOW ルールの 5.52% に登場し、次に CCBot(5.08%)、ClaudeBot(4.88%)が続きます。しかし研究はさらに、AIクローラトラフィックの約80%がトレーニング型ボットから来ていることも示しています—つまり、最もブロックされているのは実は直接的な害を最小限のカテゴリなのです。

真の危険性は:WAF や CDN ルールを設定している多くのセキュリティチームがこの3つの分類を区別していません。単純な「Google 以外の検索エンジンクローラをすべてブロック」ルールが、同時に ChatGPT、Perplexity、Claude でのブランドの可視性を破壊してしまう可能性があります。

CDN層の防御がrobots.txtに取って代わる

robots.txtの問題は昔からありました—それは本質的に「丁寧な要望」であり、強制力のある仕組みではありません。しかしAI時代において、この弱さがより重要な影響を及ぼしています。

Cloudflareの次の動き:9月15日よりトレーニングとエージェントクローラをデフォルトブロック

Cloudflareは2026年9月15日以降、新規登録ドメインで広告表示ページ上の「トレーニング型」と「エージェント型」AIクローラのブロックをデフォルトにする予定ですが、検索型のクローラは許可されたままとなります。方向性は明確です:「検索での発見可能性」と「モデル訓練への使用」を分離管理するということです。

コンテンツ出版社にとっては良いかもしれません—記事が引用されながら訓練データには含まれない。しかしB2Bサービスプロバイダにとって、ChatGPT がリアルタイムであなたのソリューションページを読み取れなければ、リード変換の漏斗は壊れます。

目に見えないコスト:中小企業の現実的な問題

AIクローラは大量の有効でないトラフィックを生成し、CDN帯域幅とリクエスト割当を消費します。Cloudflare のデータによると、サイトが月間10万回のボットリクエストを受けるとすると、そのうち約25,000回はAIクローラから来ています。これらのリクエストは決して顧客にはなりませんが、CDN請求書を増加させるのは事実です

問題なのは:大多数の中小企業が「価値のあるクローラトラフィック」と「純粋なコスト削減トラフィック」を区別する余裕がないことです。彼らは請求書の数字が上昇することしか見えませんが、精密にフィルタリングする方法がない—結果としてすべてをブロックするか(検索可視性を失う)、すべてを許可するか(CDN料金を無駄にする)の二択になります。

将来の傾向:有料クローリングとライセンスモデル

Cloudflare はすでに「pay-per-crawl」モデルを発表しており、出版社がAI企業にアクセス料を請求できるようにしています。つまり未来は「許可か禁止か」だけではないで、「ライセンスと価格設定」の新たな段階へと移行しているのです。コストを抑えながら AI 検索で索引されたい企業にとって、これは唯一のバランスの取れた解決策となるかもしれません。

💡 LAFA 視点

AIクローラトラフィックがボットリクエストの4分の1を占めるようになり、robots.txt で管理することはもはや非現実的です。Lafa System の AI 自動運用は CDN レベルで3つのクローラ分類をリアルタイムで識別し、フィルタリングルールをインテリジェントに調整します—検索可視性を維持するために検索型クローラを残しつつ、CDN予算だけを消費するトレーニング型クローラを精密にブロックし、インフラコストの1円1銭が実質的に稼働するようにします。