Intrix Lab
llms.txt를 AI가 읽어갈까 - 사이트 4곳을 재보니 갈렸다
(주)인트릭스 ·

사이트마다 갈렸습니다. 직접 운영하는 4곳의 봇 로그를 대조했더니, 한 곳에서는 GPTBot·OAI-SearchBot·Amazonbot이 실제로 llms.txt를 가져갔고 다른 한 곳은 0건이었습니다(2026-08-10 기준). 한 사이트만 보고 "AI는 llms.txt를 읽지 않는다"고 말할 수 없다는 뜻입니다.
사이트별로 얼마나 달랐을까?
법률 정보 사이트에서는 llms 계열 파일이 12번 수집됐습니다. GPTBot 1회, OAI-SearchBot 2회, Amazonbot 2회, Claude-SearchBot 1회, 그리고 구글·빙이 나머지입니다. Amazonbot은 주제별로 나눠둔 파일(llms-rehabilitation.txt)까지 가져갔습니다.
저희 회사 사이트에서는 0건이었습니다. AI 크롤러 10종이 1,622회 방문하는 동안 한 번도 요청하지 않았습니다. 맛집 정보 사이트는 17건이 찍혔지만 뜯어보니 측정 도구(WebPageTest·HeadlessChrome)와 미분류 봇이 대부분이고, 진짜 AI는 1건뿐이었습니다.
남은 한 곳은 잴 수 없었습니다. 그 사이트의 로그가 robots.txt를 포함해 이런 경로를 아예 기록하지 않습니다. 0으로 보이지만 측정이 안 되는 것이라 근거로 쓰지 않았습니다.
왜 어떤 사이트만 가져갔을까?
짚이는 이유를 하나씩 확인했는데 전부 맞지 않았습니다.
robots.txt에 파일 위치를 적어둬서일까 싶었지만, 가져간 법률 사이트는 robots.txt에 llms 언급이 0건이고 오히려 가져가지 않은 쪽이 30건 적어두고 있었습니다. HTML이나 사이트맵에 링크가 있어서일까 싶었지만 이것도 반대였습니다. 가져간 사이트는 링크가 없고, 0건인 저희 사이트에는 링크가 있습니다.
즉 저희가 아는 발견 경로로는 설명되지 않습니다. 도메인 이력이나 주제 차이일 수 있지만 이 데이터로는 가릴 수 없습니다.
그래서 만들어야 할까?
결론은 처음과 같습니다. 먼저 손댈 항목은 아닙니다. 다만 이유가 바뀌었습니다. "아무도 안 읽는다"가 아니라 "사이트마다 갈리고, 읽히더라도 양이 극히 적다"입니다.
가장 많이 수집된 법률 사이트조차 robots.txt는 1,290번 가져간 반면 llms 계열은 12번입니다. 100분의 1도 안 됩니다. 만드는 비용이 거의 없으니 지울 이유는 없지만, 같은 시간이면 robots.txt와 사이트맵을 손보는 쪽이 낫습니다.
이 결과를 어디까지 믿어야 할까?
저희가 운영하는 4곳이고 업종이 제각각입니다. 다른 사이트에서 같게 나온다는 보장은 없습니다.
법률 사이트의 수집도 2026년 7월 중순에서 하순 사이에 몰려 있습니다. 상시로 가져가는 것이 아니라 그 시기에 한 번 훑었을 가능성이 있어, 재측정 없이 "가져간다"로 넓히면 안 됩니다.
이 글은 처음에 저희 회사 사이트 한 곳만 재고 "0건"이라고 썼던 것을 고친 것입니다. 표본 하나로 일반화한 것이 잘못이었습니다. 저희는 순위나 인용을 보장하지 않으며, 이 측정이 답하는 것은 4개 사이트에서 이 파일이 얼마나 수집됐는가까지입니다.
자주 묻는 질문 (FAQ)
Q. llms.txt가 표준인가요?
제안된 규약이며 공식 표준이 아닙니다. 검색엔진이나 AI 사업자가 이 파일을 읽겠다고 문서로 밝힌 바는 확인되지 않았습니다.
Q. 우리 사이트는 어떻게 확인하나요?
서버 로그나 CDN 로그에서 /llms.txt 요청을 봇 이름별로 세어 보십시오. 측정 도구나 사람의 접속이 섞이므로 봇 이름을 반드시 함께 봐야 합니다.
Q. 그럼 무엇을 먼저 해야 하나요?
robots.txt에서 AI 크롤러를 허용하고 있는지, 사이트맵이 최신인지부터 확인하십시오. 네 사이트 모두에서 그 둘이 llms 계열보다 훨씬 많이 수집됐습니다.