본문으로 건너뛰기
유환호 연락하기

홈 / 기록

열어도 안전해 보이는 페이지 15,831장을 열지 않기로 했다

한눈에 답변

수집한 공고 상세 페이지 15,831건을 전부 색인 제외로 묶어 뒀는데, 구글은 중복을 벌점이 아니라 URL 단위 정규화로 처리하니 전량 차단이 과도하다는 반론이 성립할 것처럼 보였다. 실측 결과는 달랐다 — 고유 본문을 가진 페이지가 0건이었고, 요약문의 39%와 제목의 24%가 다른 페이지와 완전히 같은 문자열이었다. 열어도 얻을 것이 없어 차단을 유지하기로 했다.

어떤 반론이 있었나

수집한 공고 상세 페이지 15,831건을 검색 제외로 묶어 둔 상태였다. 구글은 중복 콘텐츠를 다루는 방식이 네이버와 달라서, 벌점을 주는 대신 여러 URL 중 하나를 대표로 뽑아 정규화하는 방식을 쓴다. 이 원리대로라면 “전부 막을 필요 없이 열어 둬도 구글이 알아서 정리한다”는 반론이 성립할 것처럼 보였다.

실측해 보니 무엇이 나왔나

실제로 열었을 때 얻을 것이 있는지를 숫자로 확인했다. 고유한 본문을 가진 상세 페이지는 전체 중 0건이었다. 상세 페이지에 있는 고유 텍스트라고는 제목과 정형 필드로 만든 평균 49자짜리 요약뿐이었는데, 이 요약문이 다른 페이지와 글자 단위로 완전히 같은 경우가 39%였고, 제목이 완전히 같은 경우는 24%(한 문구가 최대 23개 URL에서 반복)였다. 더 두꺼운 조합 페이지조차 이전 실측에서 색인이 0건이었다는 선례도 있었다.

구조적으로는 왜 이렇게 됐나

같은 공고가 여러 플랫폼에 동시에 올라올 때 이를 병합하는 로직이 코드에 없었다. 각 수집 작업이 사이트와 원본 ID만으로 기존 행을 찾다 보니, 같은 업체의 같은 공고라도 플랫폼이 다르면 별도 URL로 쌓였다. 이게 제목이 완전히 같은 페이지가 다수 생기는 구조적 원인이었다.

그래서 무엇으로 판단했나

여기서 진짜 위험은 “중복 벌점”이 아니라 대규모로 재조합된 얇은 콘텐츠를 남용으로 보는 정책이라고 판단했다. 49자짜리 정형 요약을 재조합한 페이지 수천 개를 여는 것은 그 경계에 가깝고, 이런 신호는 사이트 전체 단위로 평가돼 목록·가이드 페이지의 순위까지 함께 끌어내릴 수 있다. 그래서 색인 차단은 유지하되, 이 페이지들이 다른 페이지로 내보내는 내부 링크 신호까지 막고 있던 설정만 풀어 링크 가치는 흐르게 했다.

다시 열 조건은 무엇으로 정했나

네 가지 조건을 전부 채운 뒤에만 재검토하기로 했다 — 플랫폼 간 중복을 실제로 병합해 동일 제목 비율을 낮출 것, 원본에 없는 고유한 정보 블록을 추가할 것, 그 블록이 페이지마다 실제로 다른지 검증할 것, 그리고 곧 사라지지 않는 장수명 공고 일부만 골라 제한적으로 실험해 볼 것. 네 조건 중 하나라도 비면 열지 않기로 했다.

이 사건에서 얻은 교훈

일반 원리(“정규화가 있으니 괜찮다”)가 이 사이트에도 적용되는지는 실측으로 확인해야 한다. 원리는 맞아도 전제(열었을 때 얻을 고유한 것이 있는가)가 성립하지 않으면 결론이 달라진다.