사전 등록 문서

목록 글이 AI 참조 진입을 만드는가 — 사전등록

상태: 사전등록 (개입 전) 등록일: 2026-08-17 개입 투입: 2026-08-17 21:09 KST 발행 완료 (8편 동시) 판정 예정: 2026-10-03 (W3) · geo-methods-40 실행(10-06) 전 기준선: 2026-08-17 자사 퍼널 400콜(funnel2-*.jsonl)


0. 먼저 — 공동개입 검사

🔴 자사 자산에 개입이 겹치면 어느 것의 효과인지 영원히 가릴 수 없다. 등록 전에 확인했다.

실험 대상 기간 겹치나
geo-methods-40 intrix.kr 페이지 80개 2026-10-06 실행 ~ +8주 ⛔ 겹치면 안 됨
citation-funnel intrix.kr (관측) ~2026-08-24 관측이라 무해
geo-rct 크덤집 ~2026-10-05 다른 자산
lastmod-cointervention 크덤집 사이트맵 ~2026-08-25 자산이 다르다 — 무관
crawler-observatory 로그 관측 상시 무해

따라서 이 실험은 2026-10-05 까지 끝낸다. geo-methods-40 은 10-06 실행이므로 창이 47일이다.

🔴 초안에서 lastmod-cointervention 을 잘못 읽었다(2026-08-17 수정). "사이트맵 lastmod 실험이 08-25 까지 도니 발행을 08-26 이후로 잡는다"고 적었는데, 그 실험의 대상은 크덤집(피부과 정보 사이트)이지 intrix.kr 이 아니다. 그 사전등록 문서에 이렇게 적혀 있다 — "같은 결함을 인트릭스 자사 사이트에서도 찾았고 그쪽은 즉시 고쳤다. 실험이 걸려 있지 않기 때문이다." intrix.kr 에 글을 올리는 것은 크덤집 사이트맵과 무관하다. 이 제약은 없다.

따라서 실제 제약은 geo-methods-40(10-06 실행) 하나뿐이고, 발행을 앞당길 수 있다. 앞당기면 관측 창이 늘어난다 — 색인·AI 참조가 자리 잡을 시간이 그만큼 더 생긴다.

🔴 잔류 효과를 미리 밝힌다. 이 실험의 목록 글은 10-06 이후에도 사이트에 남는다. geo-methods-40 의 기준선은 "목록 글이 있는 intrix.kr" 이 된다. 그 실험은 짝 안에서 배정하므로 사이트 수준 기준선 변화가 짝 차분에서 상쇄되지만, 그 문서에 이 사실을 추가로 기록해야 한다. 이 실험 착수 시 geo-methods-organic-retrieval.md 에도 한 줄 남긴다.


1. 왜 이 질문인가

2026-08-17 자사 퍼널 400콜에서 나온 것:

관측
ChatGPT 가 site:도메인 으로 콕 집어 조회한 도메인 60곳 — 평균 읽힘 22.5회, 92%가 인용됨
지목 안 된 도메인 891곳 — 평균 4.1회, 16%
자사 site: 지목 0회
자사 참조 / 인용 1차 6·1 / 2차 1·0 (각 200콜)

그리고 지목되는 이름이 어디서 나오는지 URL 단위로 확인했다 — 업체 목록·비교 글이다.

zestcompany.co.kr 읽힌 URL 25개 중 상위
  125회 /blog/geo-agency-top5-2026/     116회 /geo-agency-top5-2026/
   85회 /geo-series/07-geo-agency-guide/  34회 /geo-series/08-geo-marketing-agency-top5/

자사도 같은 글이 있다intrix.kr/insights/geo/korea-geo-agency-comparison-2026. 그런데 400콜 내내 한 번도 읽히지 않았다. 읽힌 자사 URL 은 홈 1회가 전부다.

🔴 그래서 관측으로는 더 못 간다. 목록 글이 있는 곳은 읽히고 우리 것은 안 읽히는데, 그 차이가 (a) 목록 글의 개수·구성 때문인지 (b) 그 사이트가 원래 노출이 높아서인지 관측 데이터로는 가릴 수 없다. 무작위 배정이 필요하다.


2. 가설

H1 (주가설). 지역 목록 글을 발행한 지역의 질의에서 자사 P3(참조 집합 진입)가 발행하지 않은 지역보다 높다.

H2 (인용). P3 가 오르면 P5(인용)도 따라 오른다 — 실측 전환율 기준 [[ai-citation-selection-vs-discovery-split]] 에서 자사 전환 17%.

H3 (역효과). 목록 글이 구글 순위나 기존 페이지의 노출을 잠식한다. H1 과 배타적이지 않다. 단계를 나눠 각각 본다.


3. 설계

3-1. 배정

단위: 지역. 16개 광역·기초 지역을 정하고 8곳 처치 / 8곳 대조로 무작위 배정한다. 배정은 고정 시드 스크립트로 하고 목록을 이 문서에 박는다.

🔴 왜 페이지가 아니라 지역인가. 개입이 "그 지역 목록 글의 존재"라 페이지 단위 배정이 불가능하다. 대조 지역에는 페이지가 없어야 한다. 군집 배정의 대가는 검정력이고, 그것을 5절에서 계산했다.

3-2. 개입

처치 지역마다 지역 업체 비교 글 1편을 발행한다.

🔴 처치는 균질하지 않다 — 의도적이다. 초안은 동일 템플릿으로 지역 데이터만 갈아끼우려 했으나, 그러면 8편이 사실상 같은 글이 되어 (a) doorway page 로 색인에서 빠질 위험이 있고 (b) 사이트에 얇은 글 8편이 영구히 남는다. 지역마다 실측 재료를 따로 넣기로 했다.

그래서 추정 대상(estimand)이 바뀐다.

균질 템플릿 지역별 실질 (채택)
재는 것 특정 템플릿 1개의 효과 우리가 실제로 쓰는 방식대로 발행했을 때의 효과
강점 처치가 정확히 정의됨 실무 의사결정에 그대로 쓰임(as-implemented)
약점 실제 운영과 다름 효과를 글의 어느 속성에 귀속 못 함

귀속 불가는 원래 이 설계의 한계였다(6절) — 균질 템플릿이었어도 분량·표·슬러그 중 무엇이 작동했는지는 못 갈랐다. 새로 잃는 것은 "8편이 같은 처치"라는 보장뿐이다.

고정하는 것과 자유로운 것을 나눠 박는다.

고정 (전 지역 동일) 자유 (지역별로 다름)
섹션 구성·순서 비교표에 실리는 업체(기계 선정)
분량대 8,000~12,000자 그 지역 검색 결과의 구성 분석
URL 패턴 업체별 사실 기술의 내용
작성 주체 고지 문구 지역 시장 서술
발행일(08-26 동시)

🔴 결과 보고 시 지역별 글의 실제 차이(분량·표 행수·섹션 수)를 함께 낸다. 처치 강도가 지역마다 달랐다는 사실을 숨기면 효과 크기를 오독하게 된다.

  • URL: /insights/geo/{지역}-geo-agency-comparison-2026
  • 구성: 선택 기준 → 업체별 비교표 → 지역 특성 → 방법론 주석
  • 분량 8,000~12,000자 (실측: 읽히는 목록 글 중앙값 14,843자, 자사 기존 글 4,841자)

비교표에 넣을 업체 — 기계적으로 뽑는다 (사전 고정)

🔴 사람이 고르면 처치의 내용이 지역마다 달라지고, 그것이 처치 효과와 섞인다. 규칙을 박고 스크립트로 뽑았다 — scripts/research/backlink/listicle-selection.json.

해당 지역 3개 질의의 구글 상위 30에서, 도메인 대장 자격을 통과한 업체를 등장 질의수 내림차순 → 최고 순위 오름차순 → 도메인 사전순으로 정렬해 상위 8곳. 자사는 작성 주체로 별도 행에 표기하며 순위를 매기지 않는다.

구글을 쓰는 이유는 코호트 선정(8-1절 인용 퍼널)과 같다 — 결과변수가 OpenAI 참조인데 선정을 OpenAI 로 하면 순환이 된다. 독립 엔진을 선정에만 쓴다.

결과: 8지역이 서로 다른 8개 조합을 얻었다(전 지역 공통 3곳, 특정 지역에만 8곳). 지역 문서가 사실상 같은 글이 되는 것 — 곧 doorway page 로 취급돼 색인에서 빠지는 것 — 을 피하는 데도 이 규칙이 필요했다.

발행

8편을 같은 시각에 동시 발행한다. 지역마다 발행일이 다르면 그 자체가 변수가 된다.

2026-08-17 21:09 KST(12:09 UTC) 발행 완료. 초안은 08-26 이었으나 근거였던 lastmod 제약이 오독이었다(0절). 실제 제약은 geo-methods-40(10-06) 하나뿐이라 당일로 앞당겼다 — 관측 창이 5.4주에서 6.7주로 늘었다.

🔴 W0 가 발행보다 앞선 것을 확인했다. 같은 날이라 순서가 뒤집혔으면 기준선이 처치 후 값이 된다. 마지막 W0 수집은 OpenAI 10:20 UTC · Gemini 11:03 UTC 이고 발행은 12:09 UTC 다 — 각각 109분 · 66분 앞이다.

🔴 자기를 1위로 놓는 목록은 쓰지 않는다. 경쟁사 사례에서 자사 순위 부여가 관측되지만, 그것을 따라 하면 (a) 우리가 RCT 를 운영하며 방법론을 파는 회사라는 위치와 충돌하고 (b) 결과가 나와도 "순위 조작이 먹혔다"는 해석을 못 배제한다. 작성 주체를 명시하고, 순위 대신 기준별 비교표를 쓴다. 자사도 한 행으로 넣되 다른 업체와 같은 기준으로 기술한다.

3-3. 결과변수

정의 단위 분모
P3 그 지역 질의 호출에서 action.sourcesintrix.kr 등장 호출 검색 발동 호출
부 P5 url_citation 에 등장 호출 검색 발동 호출
부 site: 재작성 검색어에 site:intrix.kr 등장 호출 검색 발동 호출
안전 H3 그 지역 질의의 구글 상위 30 내 자사 URL 수 질의 전체

🔴 H3 은 바닥 효과로 측정되지 않을 가능성이 크다. 2026-08-17 실측에서 자사의 구글 노출은 48질의 중 0건이다. 0 에서 더 내려갈 수 없으므로 "잠식"을 잴 수 없다. 개입이 먼저 노출을 만들어야 그 뒤의 감소를 볼 수 있다. 그 경우 H3 은 NOT ESTIMABLE 로 끝내고 "역효과가 없었다"고 쓰지 않는다. 이 사실을 지금(개입 전) 기록해 둔다.

측정은 기존 하네스 그대로다collect-funnel.ts (URL·액션축·span 저장판).

3-4. 관측 시점

회차 시점 목적
W0 2026-08-17 (완료) 기준선. 발행 109분/66분 전
W1 발행 +2주 (08-31) 색인 반영 확인 — 결과변수는 보지 않는다
W2 발행 +4주 (09-14) 봉인
W3 발행 +6.7주 (10-03) 주 판정

🔴 W1·W2 는 보지 않는다. 중간 결과를 보면 멈추거나 손대고 싶어진다. W3 까지 봉인하고, 봉인 해제 후 한 번에 분석한다. 색인 실패 같은 운영 사고만 W1 에서 확인한다(자사 페이지가 구글에 색인됐는가 — 결과변수가 아니다).


3-5. 확정 배정 (2026-08-17, 시드 20260826)

16지역 = 17개 광역지자체 − 세종. 세종은 인구 39만이고 광고·웹 대행사 시장이 사실상 없어 P3 가 구조적으로 0 이다.

🔴 단순 무작위를 짝 배정으로 교체했다(결과 관측 전). 처음 돌린 단순 무작위는 처치가 서울·부산을, 대조가 경기·인천을 가져가 규모 불균형이 컸다. n=8 에 시장 규모가 극단적으로 치우친 상황이라 그대로 가면 처치 효과와 시장 크기가 섞인다. 인구 순으로 8쌍을 만들고 쌍 안에서 무작위 배정으로 바꿨다. 폐기한 v1 배정도 queries-listicle.jsonsuperseded_v1 에 해시와 함께 남겼다 — 결과를 보고 고른 것이 아님을 검증할 수 있게 한다.

지역(인구 만명) 처치
1 경기 vs 서울 경기
2 부산 vs 경남 부산
3 인천 vs 경북 경북
4 대구 vs 충남 충남
5 전남 vs 전북 전남
6 충북 vs 강원 충북
7 대전 vs 광주 광주
8 울산 vs 제주 울산

처치 인구 합 2,746만 · 대조 2,340만.

배정 SHA-256 (처치 8곳 정렬 후 개행 결합)
573adb7c3c6d4ed9ff5aba3767a489117b949d0a0ba388a15e0c5ae924ee133b

질의 48개 = 16지역 × 문형 3(L-A·L-B·L-C, 인용 퍼널 배터리와 동일 문형). 전문은 scripts/research/backlink/queries-listicle.json.


3-6. 관측 기간 중 사이트 변경 — 무엇이 되고 무엇이 안 되나

실험이 도는 47일 동안 사이트를 얼려둘 수는 없다. 기준을 박는다.

🔴 판단 기준은 "개입이냐"가 아니라 "군에 따라 다르게 걸리느냐"다. 배정 단위가 지역이므로, 전 지역에 똑같이 걸리는 변경은 DiD 차분에서 지워진다. lastmod-cointervention 사전등록도 같은 논리를 쓴다 — 무작위 배정이 공통 충격을 흡수한다.

해도 되는 것 하면 안 되는 것
지역 중립 콘텐츠 추가(소개·방법론·서비스 설명) 특정 지역을 언급하는 콘텐츠
전역 내비게이션·푸터에서 균일하게 링크 처치 지역 글에서만 링크
사이트 전체에 걸리는 기술 개선 처치 지역 페이지만 손보는 것
새 지역 목록 글 추가(처치 자체가 바뀐다)

절차: 변경은 W1(08-31) 이전에 한 번에 넣고 아래 표에 날짜와 내용을 남긴다.

🔴 08-18 변경분 귀속 경고. 아래 두 건은 같은 날 함께 넣었다. 사이트 전역 P3 가 움직여도 어느 쪽 때문인지 가릴 수 없다. DiD 차분에서는 지워지지만(전 지역 공통), 부수 지표를 볼 때는 두 개입이 섞여 있다는 것을 먼저 밝힌다. 관측 회차 사이에 흩어 넣으면 그 구간 해석이 흔들린다.

날짜 변경 지역 중립 기록자
(예정) 소개란에 INTRIX 40 Needs Methodology 추가 확인 필요
2026-08-18 실적 상위 4편에 FAQ 3쌍씩 추가(FAQPage 스키마 발생) ✅ 지역 미언급 Claude
2026-08-18 google-maps-importance-ai-era 의 "OpenAI-구글 데이터 제휴" 단정 3곳 정정 + 고지 ✅ 지역 미언급 Claude
2026-08-18 처치물 8편 본문 재작성(자기지시 문구·원자료 표 제거, 9,600→4,100자). 표 업체·순서·값은 불변 ✅ 8편 동일 개편 Claude
2026-08-19 전국 단위 글 1편 초안 등록(ai-search-optimization-agency-top-5). 지역명 미사용 ✅ 지역 미언급 Claude

⚠️ 편향은 없지만 검정력은 깎일 수 있다. 사이트 전체 P3 가 오르면 천장 효과로 처치 효과가 좁아 보인다. 다만 현재 자사 P3 는 처치군 0.0% · 대조군 2.5% 로 천장까지 멀어 실질 위험은 낮다고 본다. 결과 보고에 이 판단을 함께 낸다.


4. 판정 규칙 — 세 갈래

가설 지지 반증 판정 불가
H1 Δ P3 > 0 Δ CI 하한 > 0 Δ CI 상한 ≤ 0 0 포함
H2 Δ P5 > 0 Δ CI 하한 > 0 Δ CI 상한 ≤ 0 0 포함
H3 구글 노출 감소 없음 Δ CI 하한 > −2 URL Δ CI 상한 < −2 URL −2 포함

Δ 의 정의 — 2026-08-17 수정 (개입 전, W0 관측 후)

🔴 초안의 분석이 배정을 따르지 않았다. 짝 배정을 해놓고 Δ 를 "처치 8지역 평균 − 대조 8지역 평균"으로 적었다. 배정이 짝이면 분석도 짝이어야 한다.

🔴 그리고 W0 에서 기준선 불균형이 나왔다 — 처치군 P3 0/120(0.0%), 대조군 3/120(2.5%). 불균형분 3건은 전부 인천(대조, 3쌍)에서 나왔다. 사후 단순 비교로 가면 처치가 2.5%p 핸디캡을 안고 시작한다. 차이의 차이(DiD)로 바꾼다.

쌍 p 의 효과  d_p = (처치_W3 − 처치_W0) − (대조_W3 − 대조_W0)
Δ            = 8개 d_p 의 평균
CI           = 쌍을 복원추출하는 부트스트랩 5,000회

두 수정 모두 개입 전이고 결과(W3)를 보기 전이다. W0 는 기준선이라 봐야 정의할 수 있는 값이고, 그것을 본 뒤 무엇을 고쳤는지 여기 남긴다.

🔴 호출을 분석 단위로 쓰지 않는다. 같은 지역 호출들은 같은 페이지를 보므로 독립이 아니다. 호출 단위로 계산하면 CI 가 거짓으로 좁아진다.

🔴 "유의하지 않음"을 "효과 없음"으로 쓰지 않는다. 5절대로 이 규모는 +5%p 를 잡지 못한다. 작은 효과가 실재해도 판정 불가로 끝날 수 있고, 그것을 그대로 보고한다.


5. 검정력 — 실측 모수

scripts/research/backlink/power-listicle.py. 기준선 P3 0.030(실측 6/200), 지역당 호출 15(문형 3 × k=5), 절반 처치.

지역 수 ICC +0.05 +0.10 +0.20 +0.35
16 0.00 47% 88% 100% 100%
16 0.10 26% 57% 92% 100%
16 0.25 16% 36% 75% 96%
24 0.25 19% 49% 86% 99%

짝 차분으로 다시 계산했다(채택 설계). 8쌍 기준:

쌍 수 ICC +0.05 +0.10 +0.20 +0.35
8 0.10 27% 56% 89% 100%
8 0.25 17% 37% 70% 95%

짝 차분이 단순 비교보다 낫다(+0.20 에서 ICC 0.10 기준 92%→89%, 0.25 기준 75%→70%는 짝 고유 성향을 넣은 탓이고, +0.10 에서는 57%→56% 로 비슷하다). 결론은 바뀌지 않는다 — +20%p 는 잡고 +5%p 는 못 잡는다.

16지역으로 간다. +20%p 를 보수적 ICC(0.25)에서도 75%, 중간(0.10)에서 92% 로 잡는다. 목록 글을 운영하는 경쟁사의 실측 진입은 200콜 중 69~77회(≈35%)이고 자사는 6회(3%)다. 개입이 그 격차의 절반만 메워도 +15%p 를 넘는다.

🔴 못 잡는 것을 먼저 적는다. +5%p 는 어떤 ICC 에서도 절반 미만이다. 이 실험은 "작은 효과가 없다"를 말할 수 없다.

🔴 오염은 효과를 0 쪽으로 끈다. 부산 목록 글이 대구 질의에서 읽힐 수 있다. 따라서 위 검정력은 상한이고, 관측되는 Δ 는 실제 효과의 하한이다.


6. 답하지 못하는 것

  • 왜 읽히는지는 답하지 않는다. 목록 글의 어느 속성(분량·표·슬러그·발행처)이 작동하는지는 이 설계로 분해할 수 없다. 다음 실험의 몫이다.
  • 일반화: 자사 사이트 1곳, GEO 업종 1개, 모델 2종, 단일 시기다. 다른 업종·다른 도메인 권위에서 같은지 모른다.
  • 경쟁사가 쓴 목록에 실리는 것우리가 목록을 쓰는 것은 다른 개입이다. 이 실험은 후자만 잰다. 전자는 통제할 수 없다.
  • P3 가 올라도 매출로 이어지는지는 재지 않는다.

7. 착수 조건

  • 16지역 확정 + 짝 배정 → 위 표
  • 지역 질의 48개 확정 — queries-listicle.json
  • W0 기준선 수집 480콜 완료 (2026-08-17, 실패 0)

W0 기준선 (2026-08-17)

P3 P5 site:intrix 지목 Gemini 인용
처치 8지역 0/120 (0.0%) 0/120 0/120 2/120
대조 8지역 3/120 (2.5%) 1/120 0/120 0/120
전체 3/240 (1.25%) 1/240 0/240 2/240

대조군 3건은 전부 인천(3쌍)이다. 나머지 15개 지역은 P3 가 0 이다. site:intrix.kr 지목은 240콜 중 0건 — 후보 검증 단계에 한 번도 들어가지 못했다.

  • 처치물 8편 작성 + 예약 발행 등록 완료 (2026-08-26 09:00 KST)
  • geo-methods-organic-retrieval.md 에 잔류 효과 고지 추가
  • 이 문서 PUBLIC_SLUGS 등록

8. 변경 이력

  • 2026-08-17 초안 v1. 공동개입 검사(0절)·검정력(5절) 포함.
  • 2026-08-17 배정 확정. 단순 무작위 → 짝 배정으로 교체(결과 관측 전, 사유는 위).
  • 2026-08-17 W0 기준선 480콜 완료(실패 0) 후 두 가지 수정. ⑴ 분석을 배정에 맞춰 짝 차분으로 바꿨다 — 짝 배정인데 단순 평균 차이로 적어놨었다. ⑵ W0 에서 기준선 불균형(처치 0.0% vs 대조 2.5%)이 나와 DiD 로 바꿨다. 검정력을 짝 차분으로 다시 계산했고 결론은 같다 — +20%p 는 잡고 +5%p 는 못 잡는다.
  • 2026-08-17 3-6절 추가 — 관측 기간 중 사이트 변경 기준. 지역 중립이면 허용, 지역별로 다르게 걸리면 금지. 변경은 W1(08-31) 전에 몰아 넣고 표에 기록한다.
  • 2026-08-17 처치물 초안 8편 생성(8,070~8,229자) 후 예약 발행 등록. posts.status='scheduled', scheduled_at = 2026-08-26 00:00 UTC (09:00 KST), source='experiment-listicle'. 8편 동시. 발행 전까지 UNDO=1 npx tsx scripts/research/backlink/schedule-listicles.ts 로 취소 가능하다. 🔴 타임존을 검산했다 — 저장값은 naive timestamp 이고 서버 TimeZone 이 Etc/UTC 라 08-26 09:00 KST 에 나간다. lastmod-cointervention(08-25 종료) 뒤다.