호스팅 대시보드를 열면 모든 게 정상으로 보인다. 업타임은 안정적이고, 페이지 로딩은 빠르고, 몇 주간 아무것도 바꾸지 않았다. 하지만 대역폭 사용량은 매달 조금씩 쌓이고, PHP 워커는 예전보다 더 바쁘며, 다음 청구서에는 낯선 초과 요금이 한 줄 섞여 있다. 트래픽이 늘지 않았다면 누가 서버를 먹고 있는 걸까. 점점 더 흔해지는 답은 당신의 고객이 아니다. 바로 AI 크롤러다 — 그리고 지금도 당신의 사이트를 기우리고 있을 수 있다.
이것은 가설이 아니다. Cloudflare의 2026년 8월 데이터에 따르면 HTML 페이지 요청의 절반 이상이 더 이상 사람에서 나오지 않는다. Imperva의 연례 Bad Bot 리포트에 따르면 자동화 트래픽이 전체 웹 활동의 51%를 차지하며, 그중 '악성 봇'이 37%를 담당한다. 증가 속도도 가속 중이다: TollBit의 퍼블리셔 네트워크 추적에 따르면 AI 크롤러 대 인간 방문자 비율이 2025년 초 1:200에서 4분기 1:31로 — 1년 만에 6.5배로 악화되었다. 당신의 사이트는 이 홍수 속의 한 방울이다.
일반 봇이 캐시를 좀 어지럽히는 정도라면, AI 학습 크롤러는 서버에게 무급 노동을 강요한다. 진짜 아픈 건 그 행동 패턴이다:
호스팅 패널은 대역폭·디스크·CPU를 보여 주지만, '누가 소비 중인지'는 알려주지 않는다. 화요일 오후의 대역폭 급등은 마케팅 성공인가, 아니면 ClaudeBot이 상품 카탈로그를 전부 기운 것인가? 봇 수준 가시성이 없으면 구분할 수도, 고칠 수도 없다. 많은 사이트 운영자는 '사이트가 플랜을 초과했다'고 판단해 업그레이드하지만, 실제로는 초대도 하지 않은 크롤러 군단에 비용을 지불하고 있었던 것이다.
봇 방어에서 가장 중요한 한 줄: 봇이 오리지널에 도달하기 전에 멈추어라. 봇이 서버에 닿은 순간 PHP는 이미 실행되고, 쿼리는 이미 완료되고, 대역폭은 이미 소모되었다 — 그때서야 플러그인이나 .htaccess로 차단하는 건 문이 걷어차인 뒤에 잠금을 달아놓는 것과 같다. 올바른 순서는 CDN/WAF 엣지 층에서 식별·차단하는 것이다. 요청은 엣지 노드에서 죽고, 오리지널은 존재 자체를 모른다. 비용은 제로.
robots.txt는 어떨까? 그것은 예의의 제안에 불과하다 — GPTBot·ClaudeBot 같은 '규범을 따르는' 크롤러는 대부분 준수하지만, 위장자와 불량 스크레이퍼는 완전히 무시한다. 진짜 강제력은 네트워크 층에 있다. '무엇을 막고 무엇을 남길 것인가'는 판단이 필요하다: 순수 학습 크롤러는 콘텐츠를 훔쳐가고 어떤 보상도 없다 — 막아야 한다. AI 검색 크롤러(OAI-SearchBot, PerplexityBot)는 당신의 페이지를 인용해 추천 트래픽을 보내준다 — 남겨둘 가치가 있다.
트래픽의 절반 이상이 더 이상 사람이 아닌 지금, 청구서 부상은 사고가 아니라 운명이다. Lafa System의 AI 운영보관 서비스는 엣지 층에서 24/7 무효 봇 트래픽을 자동 탐지·차단한다 — 막아야 할 것은 세컨드 단위로 막고, 인용 가치가 있는 것은 남겨 둔다. CDN과 서버 지출이 정말로 진짜 고객을 위해 쓰이게 하려면, 이 것이 답이다.