사전 등록 문서
목록 글이 AI 참조 진입을 만드는가 — 사전등록
(주)인트릭스 · 결과가 나오기 전에 확정·공개했습니다
상태: 사전등록 (개입 전)
등록일: 2026-08-17
개입 투입: 2026-08-17 21:09 KST 발행 완료 (8편 동시)
판정 예정: 2026-10-03 (W3) · geo-methods-40 실행(10-06) 전
기준선: 2026-08-17 자사 퍼널 400콜(funnel2-*.jsonl)
0. 먼저 — 공동개입 검사
🔴 자사 자산에 개입이 겹치면 어느 것의 효과인지 영원히 가릴 수 없다. 등록 전에 확인했다.
| 실험 | 대상 | 기간 | 겹치나 |
|---|---|---|---|
geo-methods-40 |
intrix.kr 페이지 80개 | 2026-10-06 실행 ~ +8주 | ⛔ 겹치면 안 됨 |
citation-funnel |
intrix.kr (관측) | ~2026-08-24 | 관측이라 무해 |
geo-rct |
크덤집 | ~2026-10-05 | 다른 자산 |
lastmod-cointervention |
크덤집 사이트맵 | ~2026-08-25 | 자산이 다르다 — 무관 |
crawler-observatory |
로그 관측 | 상시 | 무해 |
따라서 이 실험은 2026-10-05 까지 끝낸다. geo-methods-40 은 10-06 실행이므로 창이 47일이다.
🔴 초안에서 lastmod-cointervention 을 잘못 읽었다(2026-08-17 수정).
"사이트맵 lastmod 실험이 08-25 까지 도니 발행을 08-26 이후로 잡는다"고 적었는데,
그 실험의 대상은 크덤집(피부과 정보 사이트)이지 intrix.kr 이 아니다.
그 사전등록 문서에 이렇게 적혀 있다 — "같은 결함을 인트릭스 자사 사이트에서도 찾았고
그쪽은 즉시 고쳤다. 실험이 걸려 있지 않기 때문이다."
intrix.kr 에 글을 올리는 것은 크덤집 사이트맵과 무관하다. 이 제약은 없다.
따라서 실제 제약은 geo-methods-40(10-06 실행) 하나뿐이고, 발행을 앞당길 수 있다.
앞당기면 관측 창이 늘어난다 — 색인·AI 참조가 자리 잡을 시간이 그만큼 더 생긴다.
🔴 잔류 효과를 미리 밝힌다. 이 실험의 목록 글은 10-06 이후에도 사이트에 남는다.
geo-methods-40 의 기준선은 "목록 글이 있는 intrix.kr" 이 된다. 그 실험은 짝 안에서
배정하므로 사이트 수준 기준선 변화가 짝 차분에서 상쇄되지만, 그 문서에 이 사실을
추가로 기록해야 한다. 이 실험 착수 시 geo-methods-organic-retrieval.md 에도 한 줄 남긴다.
1. 왜 이 질문인가
2026-08-17 자사 퍼널 400콜에서 나온 것:
| 관측 | 값 |
|---|---|
ChatGPT 가 site:도메인 으로 콕 집어 조회한 도메인 |
60곳 — 평균 읽힘 22.5회, 92%가 인용됨 |
| 지목 안 된 도메인 | 891곳 — 평균 4.1회, 16% |
자사 site: 지목 |
0회 |
| 자사 참조 / 인용 | 1차 6·1 / 2차 1·0 (각 200콜) |
그리고 지목되는 이름이 어디서 나오는지 URL 단위로 확인했다 — 업체 목록·비교 글이다.
zestcompany.co.kr 읽힌 URL 25개 중 상위
125회 /blog/geo-agency-top5-2026/ 116회 /geo-agency-top5-2026/
85회 /geo-series/07-geo-agency-guide/ 34회 /geo-series/08-geo-marketing-agency-top5/
자사도 같은 글이 있다 — intrix.kr/insights/geo/korea-geo-agency-comparison-2026.
그런데 400콜 내내 한 번도 읽히지 않았다. 읽힌 자사 URL 은 홈 1회가 전부다.
🔴 그래서 관측으로는 더 못 간다. 목록 글이 있는 곳은 읽히고 우리 것은 안 읽히는데, 그 차이가 (a) 목록 글의 개수·구성 때문인지 (b) 그 사이트가 원래 노출이 높아서인지 관측 데이터로는 가릴 수 없다. 무작위 배정이 필요하다.
2. 가설
H1 (주가설). 지역 목록 글을 발행한 지역의 질의에서 자사 P3(참조 집합 진입)가 발행하지 않은 지역보다 높다.
H2 (인용). P3 가 오르면 P5(인용)도 따라 오른다 — 실측 전환율 기준 [[ai-citation-selection-vs-discovery-split]] 에서 자사 전환 17%.
H3 (역효과). 목록 글이 구글 순위나 기존 페이지의 노출을 잠식한다. H1 과 배타적이지 않다. 단계를 나눠 각각 본다.
3. 설계
3-1. 배정
단위: 지역. 16개 광역·기초 지역을 정하고 8곳 처치 / 8곳 대조로 무작위 배정한다. 배정은 고정 시드 스크립트로 하고 목록을 이 문서에 박는다.
🔴 왜 페이지가 아니라 지역인가. 개입이 "그 지역 목록 글의 존재"라 페이지 단위 배정이 불가능하다. 대조 지역에는 페이지가 없어야 한다. 군집 배정의 대가는 검정력이고, 그것을 5절에서 계산했다.
3-2. 개입
처치 지역마다 지역 업체 비교 글 1편을 발행한다.
🔴 처치는 균질하지 않다 — 의도적이다. 초안은 동일 템플릿으로 지역 데이터만 갈아끼우려 했으나, 그러면 8편이 사실상 같은 글이 되어 (a) doorway page 로 색인에서 빠질 위험이 있고 (b) 사이트에 얇은 글 8편이 영구히 남는다. 지역마다 실측 재료를 따로 넣기로 했다.
그래서 추정 대상(estimand)이 바뀐다.
| 균질 템플릿 | 지역별 실질 (채택) | |
|---|---|---|
| 재는 것 | 특정 템플릿 1개의 효과 | 우리가 실제로 쓰는 방식대로 발행했을 때의 효과 |
| 강점 | 처치가 정확히 정의됨 | 실무 의사결정에 그대로 쓰임(as-implemented) |
| 약점 | 실제 운영과 다름 | 효과를 글의 어느 속성에 귀속 못 함 |
귀속 불가는 원래 이 설계의 한계였다(6절) — 균질 템플릿이었어도 분량·표·슬러그 중 무엇이 작동했는지는 못 갈랐다. 새로 잃는 것은 "8편이 같은 처치"라는 보장뿐이다.
고정하는 것과 자유로운 것을 나눠 박는다.
| 고정 (전 지역 동일) | 자유 (지역별로 다름) |
|---|---|
| 섹션 구성·순서 | 비교표에 실리는 업체(기계 선정) |
| 분량대 8,000~12,000자 | 그 지역 검색 결과의 구성 분석 |
| URL 패턴 | 업체별 사실 기술의 내용 |
| 작성 주체 고지 문구 | 지역 시장 서술 |
| 발행일(08-26 동시) |
🔴 결과 보고 시 지역별 글의 실제 차이(분량·표 행수·섹션 수)를 함께 낸다. 처치 강도가 지역마다 달랐다는 사실을 숨기면 효과 크기를 오독하게 된다.
- URL:
/insights/geo/{지역}-geo-agency-comparison-2026 - 구성: 선택 기준 → 업체별 비교표 → 지역 특성 → 방법론 주석
- 분량 8,000~12,000자 (실측: 읽히는 목록 글 중앙값 14,843자, 자사 기존 글 4,841자)
비교표에 넣을 업체 — 기계적으로 뽑는다 (사전 고정)
🔴 사람이 고르면 처치의 내용이 지역마다 달라지고, 그것이 처치 효과와 섞인다.
규칙을 박고 스크립트로 뽑았다 — scripts/research/backlink/listicle-selection.json.
해당 지역 3개 질의의 구글 상위 30에서, 도메인 대장 자격을 통과한 업체를 등장 질의수 내림차순 → 최고 순위 오름차순 → 도메인 사전순으로 정렬해 상위 8곳. 자사는 작성 주체로 별도 행에 표기하며 순위를 매기지 않는다.
구글을 쓰는 이유는 코호트 선정(8-1절 인용 퍼널)과 같다 — 결과변수가 OpenAI 참조인데 선정을 OpenAI 로 하면 순환이 된다. 독립 엔진을 선정에만 쓴다.
결과: 8지역이 서로 다른 8개 조합을 얻었다(전 지역 공통 3곳, 특정 지역에만 8곳). 지역 문서가 사실상 같은 글이 되는 것 — 곧 doorway page 로 취급돼 색인에서 빠지는 것 — 을 피하는 데도 이 규칙이 필요했다.
발행
8편을 같은 시각에 동시 발행한다. 지역마다 발행일이 다르면 그 자체가 변수가 된다.
✅ 2026-08-17 21:09 KST(12:09 UTC) 발행 완료. 초안은 08-26 이었으나 근거였던
lastmod 제약이 오독이었다(0절). 실제 제약은 geo-methods-40(10-06) 하나뿐이라
당일로 앞당겼다 — 관측 창이 5.4주에서 6.7주로 늘었다.
🔴 W0 가 발행보다 앞선 것을 확인했다. 같은 날이라 순서가 뒤집혔으면 기준선이 처치 후 값이 된다. 마지막 W0 수집은 OpenAI 10:20 UTC · Gemini 11:03 UTC 이고 발행은 12:09 UTC 다 — 각각 109분 · 66분 앞이다.
🔴 자기를 1위로 놓는 목록은 쓰지 않는다. 경쟁사 사례에서 자사 순위 부여가 관측되지만, 그것을 따라 하면 (a) 우리가 RCT 를 운영하며 방법론을 파는 회사라는 위치와 충돌하고 (b) 결과가 나와도 "순위 조작이 먹혔다"는 해석을 못 배제한다. 작성 주체를 명시하고, 순위 대신 기준별 비교표를 쓴다. 자사도 한 행으로 넣되 다른 업체와 같은 기준으로 기술한다.
3-3. 결과변수
| 정의 | 단위 | 분모 | |
|---|---|---|---|
| 주 P3 | 그 지역 질의 호출에서 action.sources 에 intrix.kr 등장 |
호출 | 검색 발동 호출 |
| 부 P5 | url_citation 에 등장 |
호출 | 검색 발동 호출 |
| 부 site: | 재작성 검색어에 site:intrix.kr 등장 |
호출 | 검색 발동 호출 |
| 안전 H3 | 그 지역 질의의 구글 상위 30 내 자사 URL 수 | 질의 | 전체 |
🔴 H3 은 바닥 효과로 측정되지 않을 가능성이 크다. 2026-08-17 실측에서
자사의 구글 노출은 48질의 중 0건이다. 0 에서 더 내려갈 수 없으므로 "잠식"을 잴 수 없다.
개입이 먼저 노출을 만들어야 그 뒤의 감소를 볼 수 있다. 그 경우 H3 은 NOT ESTIMABLE
로 끝내고 "역효과가 없었다"고 쓰지 않는다. 이 사실을 지금(개입 전) 기록해 둔다.
측정은 기존 하네스 그대로다 — collect-funnel.ts (URL·액션축·span 저장판).
3-4. 관측 시점
| 회차 | 시점 | 목적 |
|---|---|---|
| W0 | 2026-08-17 (완료) | 기준선. 발행 109분/66분 전 |
| W1 | 발행 +2주 (08-31) | 색인 반영 확인 — 결과변수는 보지 않는다 |
| W2 | 발행 +4주 (09-14) | 봉인 |
| W3 | 발행 +6.7주 (10-03) | 주 판정 |
🔴 W1·W2 는 보지 않는다. 중간 결과를 보면 멈추거나 손대고 싶어진다. W3 까지 봉인하고, 봉인 해제 후 한 번에 분석한다. 색인 실패 같은 운영 사고만 W1 에서 확인한다(자사 페이지가 구글에 색인됐는가 — 결과변수가 아니다).
3-5. 확정 배정 (2026-08-17, 시드 20260826)
16지역 = 17개 광역지자체 − 세종. 세종은 인구 39만이고 광고·웹 대행사 시장이 사실상 없어 P3 가 구조적으로 0 이다.
🔴 단순 무작위를 짝 배정으로 교체했다(결과 관측 전). 처음 돌린 단순 무작위는
처치가 서울·부산을, 대조가 경기·인천을 가져가 규모 불균형이 컸다. n=8 에 시장 규모가
극단적으로 치우친 상황이라 그대로 가면 처치 효과와 시장 크기가 섞인다.
인구 순으로 8쌍을 만들고 쌍 안에서 무작위 배정으로 바꿨다.
폐기한 v1 배정도 queries-listicle.json 의 superseded_v1 에 해시와 함께 남겼다 —
결과를 보고 고른 것이 아님을 검증할 수 있게 한다.
| 쌍 | 지역(인구 만명) | 처치 |
|---|---|---|
| 1 | 경기 vs 서울 | 경기 |
| 2 | 부산 vs 경남 | 부산 |
| 3 | 인천 vs 경북 | 경북 |
| 4 | 대구 vs 충남 | 충남 |
| 5 | 전남 vs 전북 | 전남 |
| 6 | 충북 vs 강원 | 충북 |
| 7 | 대전 vs 광주 | 광주 |
| 8 | 울산 vs 제주 | 울산 |
처치 인구 합 2,746만 · 대조 2,340만.
배정 SHA-256 (처치 8곳 정렬 후 개행 결합)
573adb7c3c6d4ed9ff5aba3767a489117b949d0a0ba388a15e0c5ae924ee133b
질의 48개 = 16지역 × 문형 3(L-A·L-B·L-C, 인용 퍼널 배터리와 동일 문형).
전문은 scripts/research/backlink/queries-listicle.json.
3-6. 관측 기간 중 사이트 변경 — 무엇이 되고 무엇이 안 되나
실험이 도는 47일 동안 사이트를 얼려둘 수는 없다. 기준을 박는다.
🔴 판단 기준은 "개입이냐"가 아니라 "군에 따라 다르게 걸리느냐"다.
배정 단위가 지역이므로, 전 지역에 똑같이 걸리는 변경은 DiD 차분에서 지워진다.
lastmod-cointervention 사전등록도 같은 논리를 쓴다 — 무작위 배정이 공통 충격을 흡수한다.
| 해도 되는 것 | 하면 안 되는 것 |
|---|---|
| 지역 중립 콘텐츠 추가(소개·방법론·서비스 설명) | 특정 지역을 언급하는 콘텐츠 |
| 전역 내비게이션·푸터에서 균일하게 링크 | 처치 지역 글에서만 링크 |
| 사이트 전체에 걸리는 기술 개선 | 처치 지역 페이지만 손보는 것 |
| 새 지역 목록 글 추가(처치 자체가 바뀐다) |
절차: 변경은 W1(08-31) 이전에 한 번에 넣고 아래 표에 날짜와 내용을 남긴다.
🔴 08-18 변경분 귀속 경고. 아래 두 건은 같은 날 함께 넣었다. 사이트 전역 P3 가 움직여도 어느 쪽 때문인지 가릴 수 없다. DiD 차분에서는 지워지지만(전 지역 공통), 부수 지표를 볼 때는 두 개입이 섞여 있다는 것을 먼저 밝힌다. 관측 회차 사이에 흩어 넣으면 그 구간 해석이 흔들린다.
| 날짜 | 변경 | 지역 중립 | 기록자 |
|---|---|---|---|
| (예정) | 소개란에 INTRIX 40 Needs Methodology 추가 |
확인 필요 | |
| 2026-08-18 | 실적 상위 4편에 FAQ 3쌍씩 추가(FAQPage 스키마 발생) | ✅ 지역 미언급 | Claude |
| 2026-08-18 | google-maps-importance-ai-era 의 "OpenAI-구글 데이터 제휴" 단정 3곳 정정 + 고지 |
✅ 지역 미언급 | Claude |
| 2026-08-18 | 처치물 8편 본문 재작성(자기지시 문구·원자료 표 제거, 9,600→4,100자). 표 업체·순서·값은 불변 | ✅ 8편 동일 개편 | Claude |
| 2026-08-19 | 전국 단위 글 1편 초안 등록(ai-search-optimization-agency-top-5). 지역명 미사용 |
✅ 지역 미언급 | Claude |
⚠️ 편향은 없지만 검정력은 깎일 수 있다. 사이트 전체 P3 가 오르면 천장 효과로 처치 효과가 좁아 보인다. 다만 현재 자사 P3 는 처치군 0.0% · 대조군 2.5% 로 천장까지 멀어 실질 위험은 낮다고 본다. 결과 보고에 이 판단을 함께 낸다.
4. 판정 규칙 — 세 갈래
| 가설 | 지지 | 반증 | 판정 불가 |
|---|---|---|---|
H1 Δ P3 > 0 |
Δ CI 하한 > 0 | Δ CI 상한 ≤ 0 | 0 포함 |
H2 Δ P5 > 0 |
Δ CI 하한 > 0 | Δ CI 상한 ≤ 0 | 0 포함 |
H3 구글 노출 감소 없음 |
Δ CI 하한 > −2 URL | Δ CI 상한 < −2 URL | −2 포함 |
Δ 의 정의 — 2026-08-17 수정 (개입 전, W0 관측 후)
🔴 초안의 분석이 배정을 따르지 않았다. 짝 배정을 해놓고 Δ 를 "처치 8지역 평균 − 대조 8지역 평균"으로 적었다. 배정이 짝이면 분석도 짝이어야 한다.
🔴 그리고 W0 에서 기준선 불균형이 나왔다 — 처치군 P3 0/120(0.0%), 대조군 3/120(2.5%). 불균형분 3건은 전부 인천(대조, 3쌍)에서 나왔다. 사후 단순 비교로 가면 처치가 2.5%p 핸디캡을 안고 시작한다. 차이의 차이(DiD)로 바꾼다.
쌍 p 의 효과 d_p = (처치_W3 − 처치_W0) − (대조_W3 − 대조_W0)
Δ = 8개 d_p 의 평균
CI = 쌍을 복원추출하는 부트스트랩 5,000회
두 수정 모두 개입 전이고 결과(W3)를 보기 전이다. W0 는 기준선이라 봐야 정의할 수 있는 값이고, 그것을 본 뒤 무엇을 고쳤는지 여기 남긴다.
🔴 호출을 분석 단위로 쓰지 않는다. 같은 지역 호출들은 같은 페이지를 보므로 독립이 아니다. 호출 단위로 계산하면 CI 가 거짓으로 좁아진다.
🔴 "유의하지 않음"을 "효과 없음"으로 쓰지 않는다. 5절대로 이 규모는 +5%p 를 잡지 못한다. 작은 효과가 실재해도 판정 불가로 끝날 수 있고, 그것을 그대로 보고한다.
5. 검정력 — 실측 모수
scripts/research/backlink/power-listicle.py. 기준선 P3 0.030(실측 6/200),
지역당 호출 15(문형 3 × k=5), 절반 처치.
| 지역 수 | ICC | +0.05 | +0.10 | +0.20 | +0.35 |
|---|---|---|---|---|---|
| 16 | 0.00 | 47% | 88% | 100% | 100% |
| 16 | 0.10 | 26% | 57% | 92% | 100% |
| 16 | 0.25 | 16% | 36% | 75% | 96% |
| 24 | 0.25 | 19% | 49% | 86% | 99% |
짝 차분으로 다시 계산했다(채택 설계). 8쌍 기준:
| 쌍 수 | ICC | +0.05 | +0.10 | +0.20 | +0.35 |
|---|---|---|---|---|---|
| 8 | 0.10 | 27% | 56% | 89% | 100% |
| 8 | 0.25 | 17% | 37% | 70% | 95% |
짝 차분이 단순 비교보다 낫다(+0.20 에서 ICC 0.10 기준 92%→89%, 0.25 기준 75%→70%는 짝 고유 성향을 넣은 탓이고, +0.10 에서는 57%→56% 로 비슷하다). 결론은 바뀌지 않는다 — +20%p 는 잡고 +5%p 는 못 잡는다.
16지역으로 간다. +20%p 를 보수적 ICC(0.25)에서도 75%, 중간(0.10)에서 92% 로 잡는다. 목록 글을 운영하는 경쟁사의 실측 진입은 200콜 중 69~77회(≈35%)이고 자사는 6회(3%)다. 개입이 그 격차의 절반만 메워도 +15%p 를 넘는다.
🔴 못 잡는 것을 먼저 적는다. +5%p 는 어떤 ICC 에서도 절반 미만이다. 이 실험은 "작은 효과가 없다"를 말할 수 없다.
🔴 오염은 효과를 0 쪽으로 끈다. 부산 목록 글이 대구 질의에서 읽힐 수 있다. 따라서 위 검정력은 상한이고, 관측되는 Δ 는 실제 효과의 하한이다.
6. 답하지 못하는 것
- 왜 읽히는지는 답하지 않는다. 목록 글의 어느 속성(분량·표·슬러그·발행처)이 작동하는지는 이 설계로 분해할 수 없다. 다음 실험의 몫이다.
- 일반화: 자사 사이트 1곳, GEO 업종 1개, 모델 2종, 단일 시기다. 다른 업종·다른 도메인 권위에서 같은지 모른다.
- 경쟁사가 쓴 목록에 실리는 것과 우리가 목록을 쓰는 것은 다른 개입이다. 이 실험은 후자만 잰다. 전자는 통제할 수 없다.
- P3 가 올라도 매출로 이어지는지는 재지 않는다.
7. 착수 조건
- 16지역 확정 + 짝 배정 → 위 표
- 지역 질의 48개 확정 —
queries-listicle.json - W0 기준선 수집 480콜 완료 (2026-08-17, 실패 0)
W0 기준선 (2026-08-17)
| P3 | P5 | site:intrix 지목 |
Gemini 인용 | |
|---|---|---|---|---|
| 처치 8지역 | 0/120 (0.0%) | 0/120 | 0/120 | 2/120 |
| 대조 8지역 | 3/120 (2.5%) | 1/120 | 0/120 | 0/120 |
| 전체 | 3/240 (1.25%) | 1/240 | 0/240 | 2/240 |
대조군 3건은 전부 인천(3쌍)이다. 나머지 15개 지역은 P3 가 0 이다.
site:intrix.kr 지목은 240콜 중 0건 — 후보 검증 단계에 한 번도 들어가지 못했다.
- 처치물 8편 작성 + 예약 발행 등록 완료 (2026-08-26 09:00 KST)
-
geo-methods-organic-retrieval.md에 잔류 효과 고지 추가 - 이 문서
PUBLIC_SLUGS등록
8. 변경 이력
- 2026-08-17 초안 v1. 공동개입 검사(0절)·검정력(5절) 포함.
- 2026-08-17 배정 확정. 단순 무작위 → 짝 배정으로 교체(결과 관측 전, 사유는 위).
- 2026-08-17 W0 기준선 480콜 완료(실패 0) 후 두 가지 수정. ⑴ 분석을 배정에 맞춰 짝 차분으로 바꿨다 — 짝 배정인데 단순 평균 차이로 적어놨었다. ⑵ W0 에서 기준선 불균형(처치 0.0% vs 대조 2.5%)이 나와 DiD 로 바꿨다. 검정력을 짝 차분으로 다시 계산했고 결론은 같다 — +20%p 는 잡고 +5%p 는 못 잡는다.
- 2026-08-17 3-6절 추가 — 관측 기간 중 사이트 변경 기준. 지역 중립이면 허용, 지역별로 다르게 걸리면 금지. 변경은 W1(08-31) 전에 몰아 넣고 표에 기록한다.
- 2026-08-17 처치물 초안 8편 생성(8,070~8,229자) 후 예약 발행 등록.
posts.status='scheduled',scheduled_at = 2026-08-26 00:00 UTC (09:00 KST),source='experiment-listicle'. 8편 동시. 발행 전까지UNDO=1 npx tsx scripts/research/backlink/schedule-listicles.ts로 취소 가능하다. 🔴 타임존을 검산했다 — 저장값은 naive timestamp 이고 서버 TimeZone 이 Etc/UTC 라 08-26 09:00 KST 에 나간다.lastmod-cointervention(08-25 종료) 뒤다.