AI Search Optimization
백링크는 AI 인용에 효과가 있을까? - 2,880번 물어보고 링크 28억 건을 대조했습니다
(주)인트릭스 ·
모델에 따라 정반대였습니다. 6개 업종에 같은 질문 144개를 두 모델에 열 번씩, 모두 2,880번 던지고 등장한 2,672개 도메인의 백링크를 Common Crawl 링크 28억 건에서 대조했습니다(2026-08-16 실측). GPT-5.6에서는 링크 상위 25%가 하위보다 5.66배 인용됐는데, Gemini-3.7에서는 링크가 많을수록 오히려 덜 인용됐습니다. 같은 링크 지표가 한쪽에서 +0.272, 다른 쪽에서 -0.144입니다.
왜 이걸 쟀나
저희는 그동안 "색인되게 하라"를 처방의 중심에 놓아 왔습니다. 앞선 실험에서 구글 색인이 AI 인용을 9.53배 갈랐고, 발행 페이지 수는 색인과 함께 넣으면 효과가 사라졌기 때문입니다. 발행량은 색인의 대리 지표였던 셈입니다.
그런데 거기서 다음 질문이 막힙니다. 색인은 무엇이 만드는가. 업계 표준 답은 백링크인데, 저희에게는 그 데이터가 없었습니다. 유료 백링크 도구는 산출 방식이 공개되지 않아 재현할 수 없고, 구글의 link: 연산자는 폐기됐습니다. 그래서 Common Crawl이 공개하는 웹 링크 그래프를 직접 받아 썼습니다. 도메인 1억 1,800만 개 사이의 링크 28억 건입니다.
어떻게 쟀나
업종은 여섯 개입니다. YMYL로 피부과, 성형외과, 변호사. 비-YMYL로 홈페이지 제작, 마케팅 대행, 영상 제작. 업종마다 완전히 같은 구조의 질의 24개를 썼습니다. 하나라도 다르면 차이가 업종 때문인지 질문 때문인지 갈리지 않기 때문입니다.
질의 144개를 GPT-5.6과 Gemini-3.7에 각각 열 번씩 던졌습니다. 열 번인 이유는 한 번 재서는 알 수 없기 때문입니다. 이번 데이터에서도 GPT가 인용한 도메인의 48%가 열 번 중 딱 한 번만 등장했습니다. 한 번 뽑은 목록은 절반이 다음번에 사라집니다.
백링크가 많으면 AI가 더 인용할까?
모델에 따라 답이 갈립니다. 링크 개수로 4분위를 나눠 실제 인용 수를 봤습니다.
GPT-5.6은 링크 최하위 25%가 평균 1.12회, 최상위 25%가 5.66회 인용됐습니다. 다섯 배 차이입니다. 순위상관도 의료 계열에서 +0.272로 이번 실험에서 가장 큰 값이었습니다.
Gemini-3.7은 반대였습니다. 링크가 0개인 구간이 평균 3.95회, 중간 구간이 2.53회, 최상위가 4.40회입니다. 상관은 -0.144로 음수이고, 두 업종 블록과 링크 개수·품질 네 조합 모두에서 같은 방향이었습니다.
왜 그런지는 인용 대상을 보면 짐작됩니다. Gemini가 가장 많이 인용한 개별 업체 1,878곳은 유입 링크가 중앙값 4개뿐이었습니다. 반면 GPT가 많이 인용한 학회와 공공기관 207곳은 중앙값 93개였습니다. Gemini는 링크가 적은 개별 업체를, GPT는 링크가 많은 기관을 주로 인용합니다.
색인을 통제하면 링크 효과가 사라질까?
사라지지 않았습니다. 이 실험을 시작할 때 저희가 미리 등록한 중심 가설이 바로 그것이었습니다. 발행량이 색인의 대리 지표였던 것처럼 링크도 색인을 통해서만 작용할 것이라고 봤습니다.
결과는 반대였습니다. 색인 페이지 수를 통제하기 전과 후를 비교하면 의료 계열 GPT는 +0.272에서 +0.256으로, Gemini는 -0.144에서 -0.131로 거의 줄지 않았습니다. 비의료 계열 Gemini는 -0.131에서 -0.153으로 오히려 강해졌습니다.
가설이 틀렸다는 뜻이고, 동시에 저희 처방에 빠진 축이 있다는 뜻입니다. 링크는 색인을 통해서만 작용하는 것이 아니라 별개 경로를 갖고 있습니다.
구글 순위는 어땠나
생각보다 약했습니다. 링크 개수와 구글 상위 순위의 상관이 +0.115에서 +0.152 사이입니다. 순위 변동의 2%도 설명하지 못하는 크기입니다.
더 눈에 띄는 것은 의료 계열에서 링크가 구글 순위(+0.115)보다 GPT 인용(+0.272)을 두 배 이상 잘 설명했다는 점입니다. 저희가 미리 적어 둔 예상은 그 반대였습니다.
그래서 실무로는
링크빌딩에 예산을 넣는다면 GPT 인용이 목적일 때, 그것도 의료나 법률처럼 규제 영역일 때 말이 됩니다. Gemini가 목표라면 이번 데이터에서는 근거를 찾지 못했습니다. 구글 순위가 목적이라면 효과 대비 단가를 다시 따져 보시는 편이 좋겠습니다.
한 가지 더 있습니다. 링크 최하위 25% 구간의 유입 링크 중앙값이 0이었습니다. 절반이 넘는 업체가 링크 없이 상위권 질의에 등장하고 있습니다. 링크는 진입 조건이 아닙니다.
이 실험의 한계
가장 중요한 한계부터 적겠습니다. 이것은 관찰 연구이므로 "링크를 늘리면 인용이 는다"고 말할 수 없습니다. 반대 방향일 수 있습니다. 인용되고 순위가 높은 사이트라서 링크가 붙었을 가능성이 남아 있고, 특히 GPT가 많이 인용한 학회와 법원은 원래 링크가 많이 붙는 기관입니다. 인과를 말하려면 무작위 배정 실험이 필요하고, 저희는 그 설계를 따로 사전 등록해 두었습니다.
색인 통제도 거칠었습니다. 색인 페이지 수를 30건까지만 셌는데 2,673개 도메인 중 1,732개가 그 상한에 걸렸습니다. 큰 사이트끼리는 구분되지 않습니다. 중심 가설이 반증됐다는 것은 이 정도 정밀도의 통제로는 링크 효과가 지워지지 않는다는 뜻이지, 더 정밀한 지표로도 그렇다는 보장은 아닙니다.
표본은 질의를 던져 등장한 도메인으로 만들었습니다. 링크도 순위도 없는 업체는 애초에 들어오지 않으므로, 이 수치는 상위권 내부의 기울기이지 전 구간의 관계가 아닙니다. 업종도 여섯 개뿐이라 업종 일반으로 넓히지 않습니다.
그리고 이 결과는 API 기준입니다. 사용자가 앱에서 보는 화면과 다를 수 있습니다. 실제로 같은 회사의 다른 API 표면으로 같은 질문을 던져 보니 인용 도메인이 하나도 겹치지 않았습니다(질의 3개 예비 관찰). 이것도 별도 실험으로 확인할 예정입니다.
마지막으로, 어떤 수치도 특정 결과를 보장하지 않습니다. 상관계수는 평균적인 경향이고 개별 사이트가 그 경향을 따른다는 보장은 없습니다.
자주 묻는 질문 (FAQ)
Q. 그래서 백링크 작업을 해야 하나요, 말아야 하나요?
목표를 먼저 정하셔야 합니다. GPT 인용이 목표이고 의료나 법률 업종이라면 이번 데이터에서 가장 큰 관계가 관측됐습니다. Gemini 인용이 목표라면 근거를 찾지 못했습니다. 다만 관찰 연구라 효과를 보장하지는 않습니다.
Q. 왜 모델마다 결과가 다른가요?
인용하는 대상이 다르기 때문으로 보입니다. Gemini는 유입 링크가 중앙값 4개인 개별 업체를 주로 인용했고, GPT는 중앙값 93개인 학회와 공공기관을 주로 인용했습니다. 같은 링크 지표가 두 모델에서 다른 의미를 갖습니다.
Q. 이 수치를 우리 사이트에 그대로 적용할 수 있나요?
어렵습니다. 여섯 개 업종에서 상위권에 등장한 도메인들의 평균적 경향이고, 표본에 들어오지 않은 신규·소규모 사이트에는 다른 이야기가 적용될 수 있습니다. 저희 자사 도메인 세 개도 링크 데이터에 잡히지 않았습니다.
Q. 설계와 원자료를 볼 수 있나요?
사전 등록 문서를 공개하고 있습니다. 수집을 시작하기 전에 가설과 분석 방법을 먼저 등록했고, 분석 코드도 링크 데이터가 생기기 전에 작성해 커밋했습니다. 결과를 보고 분석을 고르면 원하는 그림이 나오기 때문입니다.