#035
2026-09-11

AI 크롤러 트래픽의 63%는 단 두 곳: AmazonBot과 Meta가 당신의 CDN 대역폭을 먹고 있다

📰 더 많은 뉴스를 보시겠습니까?
전체 뉴스 목록 보기

51Degrees가 최근 발표한 연구는 30억 회의 실제 사이트 방문(2026년 5월 29일까지 1년간)을 기반으로, 통신·미디어·소매·결제·기술 등 산업을 아우른다. CDN 청구서를 지불하는 누구에게나 세 개의 숫자를 볼 가치가 있다: AI 봇 트래픽이 전년 대비 62.5% 증가했으며, 전체 웹 세션의 13%(去年 8%)를 차지하고, 식별된 72개 AI 관련 크롤러 중 AmazonBot과 Meta-External-Agent 두 곳만 그 트래픽의 63%를 차지한다.

대역폭을 실제로 먹는 것은 헤드라인의 이름이 아니다

지난 1년간 AI 크롤러 논쟁은 GPTBot·CCBot·ClaudeBot — 헤드라인과 법정을 장식한 이름들 — 이 중심이었다. 하지만 51Degrees의 데이터는 전혀 다른 이야기를 들려준다: 1일 기준 AmazonBot은 643만 세션(전체 웹 트래픽의 4% 이상), Meta-External-Agent는 약 423만 세션(3%)를 기록했다. 반면 가장 화제의 ClaudeBot은 1일 약 28.8만 세션으로 7위, OpenAI Search Bot은 약 12.9만 세션으로 9위. 상위 4개 크롤러(AmazonBot, Meta, AhrefsBot, BingBot)만으로 전체 크롤링 세션의 85%를 소비한다.

이름보다 '부하의 형태'가 중요하다. Known Agents는 AmazonBot을 「매우 광범위하고 대량인 스윕 수집, 1 방문당 가져가는 페이지 수가 일반 검색 크롤러보다 훨씬 많음」으로 설명한다. 목표가 명확한 학습 크롤과는 근본적으로 다른 부하 프로파일로, 오리지널 서버의 메모리·캐시 히트율·egress 대역폭에 직접적으로 부딪힌다. 오리지널은 지연을 느끼고, 청구서는 금액을 느낀다.

진짜 문제: 봇은 규칙을 지키고 있다. 규칙이 작성되어 있지 않을 뿐

이 연구에서 가장 반직관적인 한 줄: AI 크롤러의 robots.txt 준수율은 95.6%. 다시 말해 "규칙을 어기는 봇" 문제는 거의 없으며 — 갭은 규칙 측에 있다: 추적 대상 퍼블리셔는 평균적으로 robots.txt에 약 21%의 AI 크롤러만 차단하고 있다. 커버리지는 100%에서 약 2%까지 차이가 나며, 이 차이는 기술 역량과는 무관하다. 전부는 「마지막으로 이 파일을 열어 최신 user-agent 목록과 대조한 시점」만으로 결정된다.

한 마디로: 봇은 당신의 규칙을 따르고 있다 — 다만 그 규칙은 그들이 존재하기 전에 작성된 것이다.지난해의 robots.txt가 2026년 크롤러 환경에 부딪힌다면, 그것은 기간 만료된 출입 카드에 불과하다.

모든 "환대"에는 실제 비용이 있다

모든 봇 세션은 청구서에 청구된다: 오리지널 요청, 캐시 미스, egress 대역폭, DB 쿼리 — 그 대가로 얻는 가치가 제로일 수 있다. 검색 크롤러는 랭킹과 트래픽을 가져온다. 이것은 비즈니스다. 대규모 학습 스윕 수집이 가져온 것은 대역폭 청구서뿐. "차단할 것인가, 허용할 것인가"는 이진択이 아니라, 봇별로 결정해야 한다 — 검색 리퍼럴을 만드는 것은 허용하고, 고트래픽·저가치의 것은 레이트 리미팅 또는 차단하며, 변경 없는 페이지의 반복 수집을 우선 처리한다. 그리고 robots.txt는 "예의 바른 요청"에 불과하다. 나머지는 CDN/WAF 계층의 레이트 리미팅과 WAF 규칙이 에지에서 실제로 트래픽을 차단한다.

이번 주에 할 수 있는 세 가지

💡 LAFA 관점

가장 비싼 봇 트래픽은 대개 당신이 존재 자체를 몰랐던 것이다. Lafa System의 AI 24/7 로그 분석이 진정한 대역폭 대가를 찾아내고, WAF 에지 계층에서 허용·레이트 리미팅·차단의 봇별 정책을 자동으로 실행 — CDN 청구서에는 실제로 환대하려는 트래픽 분만 지불하게 된다.