Technical SEO

AI 봇 허용과 실제 접근을 따로 검사하는 이유

작성 발행

AI 검색 노출을 점검할 때 robots.txt만 보고 “열려 있다”고 결론 내리면 실제 상태를 놓칠 수 있습니다. robots.txt는 사이트 운영자가 크롤러에게 전달하는 접근 지침이지만, 요청이 서버에 도달한 뒤 CDN, 웹 방화벽, 봇 차단 정책이나 애플리케이션이 다른 응답을 줄 수 있습니다. 인트릭스 진단은 선언된 정책과 실제 접근 결과를 별도 항목으로 다루고, 그 뒤에 받은 HTML이 읽을 만한 내용인지 확인합니다.

robots.txt가 말해 주는 것과 말하지 않는 것

robots.txt에서는 사용자 에이전트별 허용과 차단 경로를 확인할 수 있습니다. 특정 AI 검색봇을 명시적으로 막거나 전체 크롤러에 중요한 경로를 차단했다면 수집 가능성이 낮아집니다. 그러나 파일이 없거나 허용으로 적혀 있다는 사실은 서버가 요청을 정상 처리한다는 증거가 아닙니다. 로그인, 지역 제한, 속도 제한, CAPTCHA와 데이터센터 IP 차단은 다른 계층에서 작동할 수 있습니다.

실제 사용자 에이전트 접근 점검

인트릭스는 발견된 robots 정책을 바탕으로 대상 사이트에 실제 접근을 시도하고 선언과 응답이 일치하는지 살핍니다. 정상 브라우저 요청은 열리지만 AI 봇을 나타내는 요청만 거부된다면 “허용 선언”과 “실제 차단”을 구분할 수 있습니다. 다만 단일 진단 환경의 결과가 전 세계 모든 크롤러 위치와 시간을 대표하지는 않습니다. 일시적 과부하나 네트워크 문제도 가능하므로 실패 유형과 측정 시각을 함께 봐야 합니다.

접근 성공 뒤에는 렌더링을 봅니다

상태 코드가 정상이어도 HTML에 메뉴와 빈 컨테이너만 있고 핵심 문장이 자바스크립트 실행 뒤에 추가되면 일부 AI 크롤러가 사용할 내용이 부족할 수 있습니다. 진단은 수집한 HTML과 실제 페이지의 콘텐츠 비율을 분석해 렌더링 문제를 찾습니다. 이미지 안에만 있는 진료 설명, iframe에 들어간 핵심 본문, 진입 즉시 본문을 덮는 팝업도 읽기와 이해에 장애가 될 수 있습니다.

AI 접근성은 “robots에서 허용”이라는 한 줄이 아니라 정책, 실제 HTTP 응답, 받은 HTML의 내용이라는 세 단계로 검증해야 합니다.

수정할 때의 우선순위

명시적 robots 차단은 정책의 의도부터 확인한 뒤 필요한 검색봇 범위만 조정합니다. 실제 요청이 방화벽에서 막히면 CDN과 보안 로그를 확인하고 무조건 모든 봇을 허용하지 말아야 합니다. 렌더링이 문제라면 핵심 문장을 서버 렌더링 또는 정적 HTML로 제공하되 사용자 인터랙션까지 모두 제거할 필요는 없습니다. 보안과 발견 가능성 사이의 범위를 운영 환경에 맞게 결정해야 합니다.

진단의 한계와 활용

접근 가능하다는 판정은 AI가 반드시 수집하거나 인용한다는 뜻이 아닙니다. 반대로 한 번의 실패도 영구 차단을 확정하지 않습니다. 인트릭스 무료 진단에서 선언, 실측과 렌더링 결과를 함께 확인하고 서버 변경 뒤 재점검하세요. 기반 자체가 클라이언트 렌더링에 묶여 있거나 보안 설정을 통제할 수 없다면 읽히는 병원 홈페이지 구축 같은 구조적 개선을 검토할 수 있습니다.

운영팀은 변경 전후의 robots 원문, 응답 코드, 서버 로그와 HTML 샘플을 함께 보관하는 것이 좋습니다. 허용 정책을 바꾼 날짜와 방화벽 규칙 배포 날짜가 다르면 원인을 잘못 연결할 수 있습니다. 정기 점검에서는 홈페이지 한 곳만 보지 말고 실제 인용 후보가 되는 대표 진료 페이지도 같은 방식으로 확인합니다.