OBSERVATORY · BOT DIRECTORY
AI 봇 도감
주요 AI 크롤러의 정체·수집 대상·robots.txt 준수 이력입니다. 각 봇은 "학습 / 검색 인덱싱 / 사용자 대행 에이전트" 세 부류 중 하나이며, 이 구분에 따라 차단 정책과 쟁점이 달라집니다.
표기 원칙. 아래 준수 관련 서술은 각 운영사의 공개 정책과
제3자(Cloudflare·HAProxy 등)의 보고를 출처와 함께 인용한 것이며, FOODBUS의 자체
단정이 아닙니다. 우리 서버 허니팟의 준수 실측은 2026-08-08 시작되어 데이터 축적 중이므로, "우리
로그" 항목은 현재 크롤 빈도(방문 횟수)까지만 나타냅니다. 측정 방식은
관측 방법론 참조.
FOODBUS 로그 실측
최근 30일 창에서 2xx 공개 콘텐츠 요청 2,182건을 집계했습니다. 수집 시작은 2026-07-30이며 그 이전 호스트별 기록은 포함하지 않습니다.
| UA 분류 | 용도 분류 | 유효 요청 | 마지막 요청(KST) |
|---|---|---|---|
| ClaudeBot | 학습 크롤러 | 1,176 | 2026-08-07 10:14 |
| GPTBot | 학습 크롤러 | 805 | 2026-08-09 16:06 |
| OAI-SearchBot | 검색 인덱싱 | 104 | 2026-08-10 09:02 |
| ChatGPT-User | 사용자 요청 기반 fetch | 71 | 2026-08-10 09:02 |
| Yeti (네이버) | 네이버 수집 | 18 | 2026-08-10 09:46 |
| Applebot | 검색 인덱싱 | 8 | 2026-08-10 06:37 |
기준: foodbus.co.kr·www.foodbus.co.kr의 Nginx 호스트 로그, GET/HEAD 2xx 공개 콘텐츠만 포함. 정적 리소스·관리자·내부 경로·서버 자체 요청은 제외. UA 문자열 기준 집계이므로 운영사 귀속 검증과는 다릅니다. 갱신: 2026-08-10 10:44 KST
학습 크롤러
GPTBot 준수(문서)OpenAI · 학습
- 정체
- 2023년 8월 발표된 OpenAI의 학습 전용 크롤러. 미래 GPT 모델 학습용 공개 콘텐츠 수집.
- UA
...compatible; GPTBot/1.x; +https://openai.com/gptbot- IP 검증
- 가능 — OpenAI가 봇별 IP 대역을 JSON으로 공개(rDNS 검증의 모범 사례).
- 수집 대상
- 공개 본문 텍스트 전반, 특히 긴 산문·설명·전문 지식.
- 준수
- robots.txt 존중 명시.
User-agent: GPTBot으로 선별 차단 가능. - 우리 로그
- 최신 관측 기간·유효 요청 수는 위 자동 집계 표에서 확인합니다.
ClaudeBot 준수(문서)Anthropic · 학습
- 정체
- Anthropic은 봇을 셋으로 분리 — ClaudeBot(학습) / Claude-User(사용자 대행) / Claude-SearchBot(검색). 세 부류를 가장 깔끔하게 제도화했고, robots.txt에서 각각 개별 제어됩니다.
- UA
...compatible; ClaudeBot/1.0; +claudebot@anthropic.com(구형Claude-Web·anthropic-ai는 폐기).- IP 검증
- Anthropic은 현재 고정 IP 대역을 공개하지 않는다고 안내합니다. 따라서 이 페이지의 로그 수치는 우선 UA 표기 기준이며, 운영사 귀속을 확정하는 증거로 사용하지 않습니다.
- 준수
- 세 봇 모두 robots.txt 준수 명시(Claude-User 포함).
- 우리 로그
- 최신 관측 기간·유효 요청 수는 위 자동 집계 표에서 확인합니다.
Bytespider 무시 보고ByteDance · 학습
- 정체
- 틱톡 모회사 ByteDance의 AI 크롤러. 업계에서 가장 논쟁적인 봇으로 꼽힙니다.
- UA
Mozilla/5.0 (Linux; Android 5.0) ...compatible; Bytespider; spider-feedback@bytedance.com— UA에 Linux·Android·Chrome 형식이 함께 포함됩니다.- 수집 규모
- 압도적. HAProxy는 자사 AI 크롤 트래픽의 약 90%가 Bytespider 단독이었다고 보고했습니다.
- 준수
- 복수의 업계 보고가 robots.txt 무시를 지적합니다. 초당 여러 요청, 다중 IP, 고부하에도 미후퇴. 일부 사이트는 하루 140만 요청(GPTBot의 약 25배)을 보고했으며, 권고는 "robots.txt로는 부족하고 서버 레벨 차단이 필요"입니다.
- 우리 로그
- FOODBUS 최신 관측 여부는 위 자동 집계 표에서 확인합니다. 미관측은 준수·비준수 판정이 아니라 이 표본에서 유효 요청을 확인하지 못했다는 뜻입니다.
검색 인덱싱
OAI-SearchBot 준수(문서)OpenAI · 검색
- 정체
- ChatGPT 검색/SearchGPT에서 웹사이트를 링크·인용하기 위한 색인 봇. 학습(GPTBot)과 완전히 별개입니다.
- 핵심
GPTBot은 막고OAI-SearchBot은 열면 = "학습은 마라, 대신 AI 검색엔 노출시켜라". 독립 토큰이라 정밀 제어가 가능합니다.- 우리 로그
- 최신 관측 기간·유효 요청 수는 위 자동 집계 표에서 확인합니다.
PerplexityBot / Perplexity-User 쟁점Perplexity · 검색/에이전트
- 정체
- PerplexityBot(검색 인덱싱) + Perplexity-User(사용자 질문 시 실시간 접근).
- 쟁점
- Perplexity의 공개 입장은 "Perplexity-User는 봇이 아니라 에이전트라 robots.txt 의무가 없다"는 것으로, 에이전트 계열을 어떻게 다룰지에 대한 회색지대를 드러냅니다.
- 스텔스 크롤링
- 2025년 8월 Cloudflare가 고발: 선언된 크롤러가 차단당하면 미선언 크롤러가 일반 브라우저(macOS 크롬)로 위장해 UA·네트워크를 바꿔 우회한다는 주장. Cloudflare는 검증된 봇 목록에서 제외했고, Perplexity는 "제3자 서비스 트래픽을 오인한 것"이라 반박했습니다.
- 우리 로그
- 최신 관측 여부는 위 자동 집계 표에서 확인합니다. UA가 없는 접근은 이 표에 포함되지 않으므로 별도 행위자 검증이 필요합니다.
겸용 · 특수 케이스
Applebot / Applebot-Extended 준수(문서)Apple · 검색+학습
- 정체
- 원래 Siri·Spotlight 검색용. 지금은 Apple Intelligence 학습도 겸합니다.
- 설계
- 크롤러(Applebot)는 하나로 두고 학습 거부만 별도 토큰(Applebot-Extended)으로 분리 — Google-Extended와 같은 방식. OpenAI(봇 2개) vs Apple·구글(봇 1개 + 토큰)의 철학 차이를 보여줍니다.
- 우리 로그
- 최신 관측 기간·유효 요청 수는 위 자동 집계 표에서 확인합니다.
네이버 Yeti 준수(문서)네이버 · 검색(→AI 겸용)
- 정체
- 네이버 검색 크롤러. UA는
Yeti(구형NaverBot). - 왜 중요한가
- 한국 생성형 AI(네이버 AI 브리핑·Cue, CLOVA X)는 별도의 AI 크롤러가 공개 문서에서 확인되지 않습니다. FOODBUS 로그에서는 Yeti를 네이버 수집으로 분류하지만, 그 요청이 특정 AI 기능의 학습·검색에 사용됐는지는 로그만으로 판정하지 않습니다.
Google-Extended 봇 아님 · 토큰
- 정체
- 크롤러가 아닙니다. 2023년 9월 등장한 robots.txt 토큰으로, 별도의 UA도 트래픽도 없습니다.
- 흔한 오해
- 실제 크롤링은 여전히 Googlebot이 합니다. Google-Extended는 "가져간 콘텐츠를 Gemini·Vertex 학습에 쓸지"만 제어하는 스위치입니다 — 로그에 나타나지 않습니다. 게다가 이를 막아도 구글 검색의 AI Overviews에는 계속 쓰입니다.
한눈에 보기
| 봇 | 운영사 | 부류 | UA/IP 투명성 | robots.txt | 우리 로그 |
|---|---|---|---|---|---|
| GPTBot | OpenAI | 학습 | UA·IP 문서 공개 | 준수(운영사 문서) | 자동 집계 표 |
| ClaudeBot | Anthropic | 학습 | UA 공개·IP 미공개 | 준수(운영사 문서) | 자동 집계 표 |
| OAI-SearchBot | OpenAI | 검색 | UA·IP 문서 공개 | 준수(운영사 문서) | 자동 집계 표 |
| Applebot | Apple | 검색+학습 | UA 문서 공개 | 준수(운영사 문서) | 자동 집계 표 |
| PerplexityBot | Perplexity | 검색 | UA·IP 문서 공개 | robots.txt 제어 문서화 | 자동 집계 표 |
| Perplexity-User | Perplexity | 에이전트 | UA·IP 문서 공개 | 별도 토큰 | 자동 집계 표 |
| Bytespider | ByteDance | 학습 | UA 확인·IP 공식 목록 미확인 | 제3자 무시 보고 | 자동 집계 표 |
| 네이버 Yeti | 네이버 | 검색 수집 | UA 문서 공개 | 네이버 문서 확인 | 자동 집계 표 |
| Google-Extended | 구글 | 토큰 | (봇 아님) | 토큰 자체 | 로그에 없음 |
해석 주의. UA 문자열은 누구나 사칭할 수 있습니다. IP 대역이 공개된
봇은 별도 검증이 가능하지만, 위 자동 집계 표는 우선 UA 표기 요청을 세는 운영 지표입니다. 빈도만으로
준수·위반이나 운영사 귀속을 단정하지 않습니다.
주요 출처: OpenAI 게시자·개발자 FAQ · Anthropic 크롤러 안내 · Perplexity 크롤러 문서 · Google 크롤러 문서 · 네이버 검색로봇 안내. 각 봇 관련 정정·반론은 admin@foodbus.co.kr 로 접수하면 근거와 함께 병기합니다. 준수 판정 방식은 관측 방법론 참조.