AI 크롤러가 실제로 오는지 처음으로 숫자를 봤다
한눈에 답변
robots.txt에서 AI 크롤러를 허용하는 설정을 코드로만 확인하고, 실제로 그 크롤러들이 방문하는지는 따로 확인한 적이 없었다. 인프라 제공업체의 봇 관리 대시보드를 처음 열어 첫 기준점을 쟀다. 하루 동안 답변엔진의 검색 소스로 알려진 크롤러가 100건 넘게 방문했고, 반대로 특정 AI 회사의 크롤러는 단 10건뿐이었다 — 이 숫자가 앞으로 늘어나는지가 이후 판단 기준이 됐다.
무엇을 확인하지 못하고 있었나
robots.txt에 어떤 크롤러를 허용하고 막는지는 코드로 정확히 확인할 수 있다. 하지만 그 설정대로 실제 크롤러가 사이트에 찾아오는지는 코드만으로는 알 수 없다. 설정과 실제 방문 사이에는 별도로 확인이 필요한 간극이 있었다.
어떻게 처음 확인했나
인프라 제공업체가 제공하는 봇 관리 대시보드를 열어 최근 24시간의 방문 기록을 확인했다. 이 화면에서 가장 먼저 확인한 것은 전체 관리 설정에서 AI 크롤러를 통째로 차단하는 옵션이 꺼져 있는지였다 — 이 옵션이 켜져 있으면 코드로 아무리 허용 설정을 해 둬도 인프라 단에서 전부 막혀 버리기 때문이다. 확인 결과 이 옵션은 꺼져 있었고, AI 크롤러 차단도 따로 걸려 있지 않았다.
실제 방문 숫자는 어땠나
하루 동안 총 9천 건 가까운 봇 방문이 있었고 그중 8천 건 이상이 정상적으로 허용됐다. 방문량이 가장 많은 것은 AI 학습용 수집 크롤러였는데 이건 특정 서비스를 겨냥한 것이 아니라 무해한 대량 수집이었다. 주목한 것은 두 크롤러였다 — 답변엔진 하나의 검색 기능이 기반으로 쓰는 크롤러가 100건 넘게 방문했고, 다른 AI 회사의 방문형 크롤러 두어 종류는 합쳐서 10건뿐이었다.
이 숫자를 어떻게 쓰기로 했나
이건 절대적인 성과 지표가 아니라 이후 변화를 비교하기 위한 기준점이었다. 이 측정을 한 시점에는 아직 배포하지 않은 개선 작업들이 있었으므로, 그 작업들이 실제로 배포된 뒤에 이 숫자가 늘어나는지를 다음 측정에서 비교하기로 했다. 가장 많이 방문한 경로가 페이지 콘텐츠가 아니라 기본 공유 이미지 파일이었다는 점도 함께 기록해 뒀다 — 크롤러가 무엇을 먼저 확인하는지도 관찰 대상이었다.
왜 이 확인이 먼저 필요했나
아무리 코드에서 크롤러를 허용해도, 인프라 단의 별도 차단 설정이나 실제 방문 여부를 확인하지 않으면 그 허용이 실제로 유효한지 알 수 없다. 설정이 옳다는 것과 그 설정이 실제로 작동하고 있다는 것은 서로 다른 확인이 필요한 별개의 사실이었다.