Intrix Lab

AI 크롤러는 매일 고르게 올까 - 1,052회 뒤 다시 1,101회

흰 바탕에 민트색 1,101회가 크게 놓여 있다. 크롤러 A의 두 번째 5일 버스트 요청 수이며, 앞선 버스트 1,052회와 사이 공백 18~21일을 함께 표시한다.

AI 크롤러 A는 매일 고르게 오지 않았습니다. intrix.kr 서버 로그에서 첫 대량 수집은 1,052회, 두 번째는 1,101회였고 그 사이에는 18~21일의 공백이 있었습니다. 2026-08-31 기준 약 3개월을 관측한 결과입니다. 평균 요청 수 하나로 이 흐름을 요약하면 실제 수집 방식인 간헐적 버스트가 사라집니다.

두 번의 버스트는 어떻게 나타났을까?

외부 플랫폼이 운영하는 크롤러 A의 User-Agent를 기준으로 2026-06-02부터 2026-08-31까지 bot_logs를 전수 집계했습니다. 운영 주체의 네트워크와 대조해 같은 이름을 사칭한 요청이 섞일 가능성도 확인했습니다. 이 기간 전체 요청은 2,205회였습니다.

첫 버스트는 2026-08-04~08-09에 1,052회였습니다. 일별 요청은 1회, 9회, 44회, 180회, 586회, 232회로 커졌습니다. 이후 18~21일 동안 대량 수집이 보이지 않았습니다.

두 번째 버스트는 2026-08-27~08-31에 1,101회였습니다. 일별로는 1회, 16회, 30회, 747회, 307회였습니다. 마지막 307회는 2026-08-31 집계 중 값이므로 종료된 하루의 확정치와 같은 방식으로 읽지 않았습니다.

같은 크롤러의 연속 방문이라고 볼 근거는 무엇일까?

2026-08-30~08-31 요청은 88~98개의 IPv6 주소로 나뉘었습니다. IP 하나가 요청한 페이지는 1~3개였습니다. 한 주소가 순서대로 사이트를 훑은 형태가 아니라, 여러 주소가 적은 페이지를 나눠 가져간 형태였습니다.

페이지 유형도 함께 분해했습니다. 이틀 동안 기타 페이지 710회, 허브 105회, 회사 정보 102회, 홈 39회, 블로그 6회였습니다. 특정 글 하나의 반복 조회가 전체 요청을 부풀린 것은 아니었습니다.

봇 이름만으로 진위를 확정하지는 않았습니다. User-Agent 원문과 운영 주체의 ASN을 대조했습니다. 다만 현재 검증 로직이 이 봇에 대응하지 않아 저장 필드에서는 검증 실패로 남았고, 사칭 판정도 10건이 있었습니다. 10건은 전체 요청의 0.5%입니다.

평균은 왜 이 패턴을 가릴까?

약 3개월 합계를 날짜 수로 나누면 매일 조금씩 수집한 것처럼 보입니다. 실제 로그에서는 2026-08-09 이후 긴 공백이 있었고, 2026-08-30에 하루 747회가 몰렸습니다. 같은 총량도 수집 시점에 따라 해석이 달라집니다.

이 차이는 전후 비교에서 특히 중요합니다. 사이트를 수정한 직후 요청이 늘었더라도 그 증가가 수정 때문인지 원래 오던 버스트인지, 대조 구간 없이 분리할 수 없습니다. 이번 관측이 지지하는 것은 크롤 요청을 일별 시계열로 남겨야 한다는 측정 규칙까지입니다.

robots.txt 요청 0건은 무엇을 뜻할까?

크롤러 A가 보낸 2,205회 요청 중 robots.txt 요청은 0회였습니다. 그러나 이 값만으로 규칙을 무시했다고 판정할 수는 없습니다. 이전에 가져간 규칙을 캐시했거나 다른 경로에서 확인했을 가능성을 서버 로그만으로 배제할 수 없기 때문입니다.

따라서 이 글은 위반을 주장하지 않습니다. 약 3개월 동안 원 서버에 도달한 이 이름의 요청에서 robots.txt 재요청이 관측되지 않았다는 사실만 남깁니다. 준수 여부를 시험하려면 금지 경로를 둔 별도 개입 설계가 필요합니다.

이 결과를 어디까지 믿어야 하나?

모집단은 intrix.kr 단일 사이트와 크롤러 A 한 종입니다. 기간은 2026-06-02~2026-08-31 약 3개월이고, 버스트는 두 번만 관측했습니다. 다른 사이트나 다른 크롤러에서도 같은 간격과 요청량이 나온다는 보장은 없습니다.

특히 두 버스트 사이의 18~21일을 주기로 부를 수 없습니다. 반복이 두 번뿐이고 두 번째 마지막 날도 집계 중이었습니다. 이 자료가 지지하는 결론은 같은 사이트에서 간헐적 대량 수집 패턴이 다시 나타났다는 데까지입니다.

서버에 도달하지 않은 요청은 로그에 없습니다. 분산 IP가 같은 작업을 나눠 수행했다는 해석도 요청 시각과 경로의 모양에 근거한 관측입니다. 인트릭스는 순위·인용·노출을 보장하지 않습니다.

같은 현상을 어떻게 다시 확인할까?

총 요청 수만 보지 않고 날짜, User-Agent, 네트워크 신원, IP별 요청 수, 페이지 유형을 같은 표에 놓아야 버스트를 구분할 수 있습니다. 인트릭스의 무료 SEO·GEO 진단은 사이트의 크롤 가능성과 응답 상태를 실제 요청으로 확인합니다. 크롤 횟수와 AI 답변 성과는 다른 지표이므로 따로 측정합니다.

자주 묻는 질문

Q. 요청이 1,101회면 AI 인용이 늘었다는 뜻인가요?
아닙니다. 서버 로그는 크롤러가 페이지를 요청했다는 사실만 보여 줍니다. 답변의 출처 선택과 본문 언급은 별도 응답 자료로 측정해야 합니다.

Q. 18~21일마다 같은 버스트가 반복되나요?
그렇게 말할 수 없습니다. 관측된 버스트가 두 번뿐이라 주기를 추정할 표본이 부족합니다. 다음 수집 시점은 열어 둔 채 일별 로그를 더 쌓아야 합니다.

Q. robots.txt를 한 번도 요청하지 않았으면 규칙을 어긴 건가요?
요청 0건만으로 위반을 판정할 수 없습니다. 규칙 캐시나 다른 확인 경로를 배제하지 못했고, 금지 경로 접근을 시험한 개입도 하지 않았습니다.

← 연구소 전체 보기

지금 무료 진단을 받아보세요

무료 진단이 모든 프로젝트의 시작입니다. 진단이 곧 계약을 의미하지는 않습니다.

무료 GEO 진단 신청 →

GEO 및 SEO의 결과는 검색·AI 서비스 정책, 경쟁 환경, 사이트 상태 등 외부 요인의 영향을 받으며, 인트릭스는 특정 순위나 인용을 보장하지 않습니다.