OBSERVATORY METHODOLOGY

AI 크롤러 관측 방법론 v1.1

FOODBUS는 AI 크롤러(봇)가 이 사이트에서 무엇을, 어떻게 수집하는지 실측하고, robots.txt 준수 여부를 검증 가능한 방식으로 기록합니다. 이 문서는 그 측정이 어떻게 이루어지는지를 공개합니다. 방법론 공개일과 관측 시작일은 모두 2026-08-08입니다.

봇의 역사   봇 도감 (8종)

1. 무엇을 측정하나

robots.txt는 사이트가 크롤러에게 알리는 표준 수집 규칙이지만 강제력이 없습니다. 우리는 "규칙을 알린 뒤 실제로 지켜지는가"를 서버 원로그 기반으로 관측합니다. FOODBUS는 robots.txt에 명시된 대로 AI 크롤러에게 개방적인 사이트이며, 이 관측은 차단이 아니라 기록을 목적으로 합니다.

2. 측정 설계 — 함정과 대조군

함정 경로 (Disallow 지정)
robots.txt에 수집 제외로 명시된 경로. 사이트 내 가시적 링크·사이트맵 어디에도 없으며, 기계만 발견할 수 있는 비가시 링크로만 연결됩니다. 규칙을 준수하는 크롤러는 이 경로에 접근할 이유도, 접근해서도 안 됩니다. (경로 자체는 robots.txt의 Disallow 줄에 공개되어 있습니다 — 통지가 곧 실험 조건입니다.)
대조군 경로 (Disallow 없음)
같은 비가시 링크로만 발견되는, 수집 제한이 없는 경로. 함정에 접근하지 않은 것이 "규칙 준수" 때문인지 "깊은 크롤을 하지 않아서"인지 구분하는 기준입니다. 대조군 설계가 없는 준수 판정은 성립하지 않는다고 보고, 모든 판정에 대조군을 전제합니다.
경로명 무작위화
흔한 경로명을 추측 순회하는 스캐너의 우연 유입을 배제하기 위해 두 경로 모두 무작위 문자열을 포함합니다. 따라서 접근 = 링크 또는 robots.txt를 읽었다는 뜻입니다.

3. 행위자 검증 — User-Agent는 증거가 아니다

User-Agent 문자열은 누구나 사칭할 수 있으므로, 접근 IP에 대해 정·역방향 교차 확인(forward-confirmed rDNS)을 통과한 경우에만 운영사를 특정합니다: IP의 PTR 레코드를 조회하고, 그 호스트명을 다시 정방향 조회해 원래 IP가 포함되는지 확인합니다. 실패하면 해당 트래픽은 운영사명이 아니라 "해당 UA를 표기한 미검증 트래픽"으로만 기록·표기합니다.

4. robots.txt 캐시 유예

크롤러는 robots.txt를 캐시하므로, 규칙 변경 직후의 접근은 이전 캐시에 따른 것일 수 있습니다. 우리는 각 크롤러의 robots.txt 조회 자체를 로그로 기록하며, 규칙 변경 이후 robots.txt를 조회한 기록이 확인된 행위자의 함정 접근만 위반으로 집계합니다. 그 전의 접근은 별도 범주로 분리합니다.

5. 판정 기준

관측 결과판정
대조군만 접근링크 추적 + robots.txt 준수
함정 접근 · 행위자 검증됨 · 변경 후 robots.txt 조회 확인위반 관측
함정 접근 · 행위자 검증됨 · 변경 후 robots.txt 조회 기록 없음위반성 접근 (캐시 유예)
함정 접근 · 행위자 미검증위반성 접근 (행위자 미검증 — 운영사를 특정하지 않음)
두 경로 모두 미접근측정 불가 (준수로 집계하지 않음)

6. 편집 원칙

7. 한계

문의·반론 — 이 방법론 또는 관측 결과에 대한 질의, 정정 요청, 반론은 admin@foodbus.co.kr 로 보내주십시오. 확인 가능한 근거와 함께 접수된 반론은 결과 페이지에 병기합니다.