INSIGHT — AI 상위노출
GEO 논문은 무엇을 말하나 — AI 답변에 인용되는 조건, 연구 12편 정리
한눈에 답변
지금까지의 연구가 공통으로 말하는 것은 세 가지입니다. 첫째, AI가 이미 읽고 있는 문서라면 출처·통계·인용구를 넣으면 답변에서 더 많이 쓰입니다(GEO 원 논문, 실험 조건 안에서 최대 40%). 둘째, 그 전에 검색돼 후보에 드는 것이 훨씬 큰 변수입니다 — 2026년 리뷰는 45편을 검토하고도 '처음 발견되는 것'을 안정적으로 높인 기법은 없다고 결론 냈습니다. 셋째, AI는 회사 자체 사이트보다 제3자 문서를 더 많이 인용하는 경향이 관측됩니다.
먼저 알아 둘 것 — 연구 대부분은 동료 심사 전이다
여기 정리한 12편 중 학회 심사를 거친 것은 GEO 원 논문(KDD 2024)과 인용 검증 연구(Findings of EMNLP 2023) 두 편뿐이고, 나머지는 arXiv 프리프린트입니다. 그리고 대부분 영어 질의로 측정했습니다. 한국어·네이버를 대상으로 한 공개 연구는 찾지 못했습니다. 아래 수치는 모두 각 논문이 밝힌 조건 안에서의 값입니다.
1. 이미 읽히는 문서라면, 근거를 넣을수록 더 쓰인다
GEO라는 말을 처음 정의한 논문(Aggarwal 외, 2023)은 1만 개 질의로 된 GEO-bench를 만들고, 구글 상위 5개 결과를 GPT-3.5에 넣어 답을 만들게 한 뒤 각 문서를 고쳐 가며 답변에서의 노출을 쟀습니다.
| 기법 | 결과(같은 실험 안의 상대 비교) |
|---|---|
| 인용구 추가 | 효과 가장 큼 |
| 통계 추가 | 효과 큼 |
| 출처 인용 | 효과 큼 |
| 키워드 반복 | 기준보다 낫지 않음 |
초록의 결론은 “가시성을 최대 40%까지 높일 수 있다”입니다. 특히 원래 순위가 낮던 문서일수록 효과가 컸다고 보고했습니다.
사이트에 옮기면: 주장마다 출처를 달고, 날짜·조건이 붙은 숫자를 쓰고, 인용할 수 있는 문장을 둡니다. 키워드를 반복하는 문장은 쓰지 않습니다.
2. 그러나 더 큰 변수는 “후보에 드는가”다
2026년 7월에 나온 비판적 리뷰(Martinez)는 2023~2026년 연구 45편을 검토했습니다. 결론은 분명합니다.
- GEO 원 논문의 수치는 “이미 정해진 문서 목록 안에 들어 있다”는 조건에서만 유효하다
- 가장 재현성이 높은 요인은 주제 관련성과 문서가 놓이는 위치다
- 일반적인 요령은 다른 조건으로 잘 옮겨지지 않고, 경쟁자가 같은 일을 하면 효과가 줄어든다
- 검토한 기법 중 처음 발견되는 것(organic discoverability)을 플랫폼을 넘어 안정적으로 높인 것은 없다
같은 방향의 결과가 하나 더 있습니다. 2026년 9월의 CITECHOICE 연구는 같은 사실을 담은 두 문서를 놓고 형식만 바꿔 봤는데, 구조화된 형식은 인용을 답변당 +0.50회 늘렸지만 전체 인용 수를 늘리지는 않았습니다(다른 출처의 몫을 가져온 것). 반면 1위와 5위 문서의 인용률 차이는 42.3%p로 형식 효과보다 훨씬 컸습니다.
사이트에 옮기면: 문장 다듬기보다 먼저 색인되고 검색 상위에 드는 것이 우선입니다. 이 사이트의 AI 상위노출 정리가 색인부터 확인하라고 하는 이유입니다.
3. AI는 회사 사이트보다 제3자 문서를 많이 인용한다
2025년 9월 Chen 외 연구는 GPT-4o 검색·Perplexity·Gemini·Claude에 순위를 묻는 질문 1,000개를 던지고 인용 출처를 분류했습니다. 미국 자동차 분야에서 AI 검색이 인용한 출처는 언론·리뷰 같은 제3자 문서(earned media)가 81.9%, 브랜드 자체 사이트가 18.1%였습니다. 같은 질문의 구글 결과는 브랜드 사이트 비중이 더 높았습니다.
2025년 12월 Zhang 외 연구(질의 55,936개, LLM 검색 6종·기존 검색 2종)는 LLM 검색이 인용한 도메인의 37%가 기존 검색엔진에는 나오지 않는 곳이었다고 보고했습니다. 구글에서 잘 나온다고 AI에도 같은 문서가 나오지 않는다는 뜻입니다.
사이트에 옮기면: 자기 사이트만 고쳐서는 한계가 있습니다. 다른 사이트에 이름이 언급되는 일(기고·인터뷰·비교 글·업계 자료)이 별도의 작업으로 필요합니다.
4. 페이지 품질 신호는 “관련은 있다”까지만 확인됐다
GEO-16 연구(2025년 9월)는 Brave·구글 AI 개요·Perplexity가 인용한 B2B SaaS 페이지 1,100개를 조사해, 메타데이터·최신성, 시맨틱 HTML, 구조화 데이터 항목이 인용과 가장 강하게 연관됐다고 보고했습니다. 다만 저자들이 직접 관찰 연구이고 영어 B2B SaaS 페이지만 봤다고 한계를 밝혔습니다.
구조화 데이터만 따로 본 실험(Volpini 외, 2026년 3월)은 “JSON-LD 마크업만으로는 개선이 크지 않았다”고 썼고, 효과가 컸던 것은 내용이 잘 정리된 엔티티 페이지였습니다. 이 연구의 저자는 구조화 데이터 도구를 만드는 회사와 관련이 있어 이해상충을 감안해야 합니다.
사이트에 옮기면: 구조화 데이터는 넣되, 그것만으로 인용이 늘 것이라고 기대하지 않습니다. 화면에 보이는 내용과 스키마가 같아야 합니다.
5. 최신 날짜를 선호하는 경향은 측정됐다
LLM 재정렬(reranking)에서 문서에 가짜 발행일만 붙여도 “최신” 문서가 위로 올라갔다는 연구가 있습니다(Fang 외). 상위 10개의 평균 연도가 최대 4.78년 앞당겨졌고, 모델이 클수록 줄었지만 사라지지는 않았습니다. 실제 서비스가 아니라 실험 환경의 결과입니다.
사이트에 옮기면: 내용을 실제로 고쳤을 때 갱신일을 정직하게 올립니다. 내용을 안 바꾸고 날짜만 올리는 것은 이 연구가 권하는 일이 아닙니다.
6. 인용됐다고 정확하게 인용된 것은 아니다
2023년 Liu 외 연구는 Bing Chat·Perplexity 등 4개 엔진의 답을 사람이 검사해, 답변 문장 중 출처로 완전히 뒷받침되는 것은 51.5%, 출처가 해당 문장을 실제로 뒷받침하는 경우는 74.5%라고 보고했습니다. 2024년 Salesforce 연구진의 후속 연구도 잦은 환각과 부정확한 인용을 지적했습니다.
사이트에 옮기면: AI가 우리를 인용했는지만 보지 말고 무엇이라고 인용했는지를 확인합니다. 틀리게 인용되면 원문의 해당 문장을 더 분명하게 고칩니다.
7. 조작은 연구 대상이지 마케팅 기법이 아니다
페이지에 숨긴 문구로 LLM의 상품 추천을 바꿀 수 있다는 연구들이 있습니다(Kumar & Lakkaraju 2024, Nestaas 외 2024). 후자는 실제 Bing과 Perplexity에서 시연하고 이를 보안 공격으로 다뤘습니다. 엔진이 막아야 할 대상이라는 뜻이므로, 이런 방법은 쓰지 않습니다.
정리 — 연구가 지지하는 순서
- 발견: 색인되고 검색 상위에 들어야 후보가 된다 — 가장 큰 변수
- 제3자 언급: 자기 사이트 밖에서 이름이 나와야 한다
- 근거 있는 문장: 출처·통계·인용구, 조건이 붙은 숫자
- 정직한 갱신일과 일치하는 구조화 데이터: 관련은 있으나 인과는 미확인
- 반복 측정: 같은 질문도 매번 답이 다르다 — 한 번의 관측으로 판단하지 않는다
이 순서를 실제 작업으로 옮긴 기록은 기록에, 검색어를 직접 재 본 결과는 고객 검색어 36개 실측에 있습니다.
자주 묻는 질문
- GEO 논문의 '최대 40% 향상'은 실제 ChatGPT에서도 그대로 나오나요?
- 그렇게 볼 근거는 없습니다. 40%는 연구진이 만든 GEO-bench에서, 구글 상위 5개 결과를 이미 넣어 준 상태로 답변을 만들 때의 상대 향상입니다. 2026년 비판적 리뷰는 이 결과가 그 실험 조건 안에서는 유효하지만 '처음 검색돼 후보에 드는 것'이나 트래픽 효과를 보여 주지는 않는다고 정리했습니다.
- 키워드를 많이 넣으면 AI 답변에 더 잘 나오나요?
- GEO 원 논문에서 키워드 반복(Keyword Stuffing)은 기준보다 나은 효과를 보이지 못했습니다. 같은 실험에서 효과가 컸던 것은 인용구 추가, 통계 추가, 출처 인용이었습니다.
- 구조화 데이터(스키마)를 넣으면 AI 인용이 늘어나나요?
- 상관관계를 보여 준 연구는 있지만 인과는 확인되지 않았습니다. B2B SaaS 페이지 1,100개를 본 GEO-16 연구는 메타데이터·최신성, 시맨틱 HTML, 구조화 데이터가 인용과 가장 강하게 연관됐다고 보고했지만, 스스로 관찰 연구라고 밝혔습니다.
- 한국어 사이트에도 이 연구들이 적용되나요?
- 직접 적용할 근거는 약합니다. 여기 정리한 연구는 대부분 영어 질의로 측정했고, 한국어나 네이버를 대상으로 한 공개 연구는 찾지 못했습니다. 그래서 한국어 사이트는 같은 질문 세트를 직접 반복 측정해 확인해야 합니다.
출처
- [1] GEO: Generative Engine Optimization (KDD 2024)
- [2] Evaluating Verifiability in Generative Search Engines (Findings of EMNLP 2023)
- [3] Generative Engine Optimization: How to Dominate AI Search
- [4] Source Coverage and Citation Bias in LLM-based vs. Traditional Search Engines
- [5] News Source Citing Patterns in AI Search Systems
- [6] AI Answer Engine Citation Behavior: An Empirical Analysis of the GEO16 Framework
- [7] Do Large Language Models Favor Recent Content? Recency Bias in LLM-Based Reranking
- [8] CITECHOICE: A Causal Audit of How Document Presentation Redistributes Citation Credit in Agentic Search
- [9] Structured Linked Data as a Memory Layer for Agent-Orchestrated Retrieval
- [10] Search Engines in an AI Era: The False Promise of Factual and Verifiable Source-Cited Responses
- [11] Adversarial Search Engine Optimization for Large Language Models
- [12] Optimizing Visibility in Generative Engines: A Critical Survey of GEO (2023–2026)