인덱스화 가능성 검사기

색인 가능성 확인
다음

한 페이지가 완벽하게 제대로 구성되어 있음에도 검색 엔진에서 인식되지 않을 수 있는데, 이는 단일 태그에 ‘noindex’가 설정되어 있거나 robots.txt 파일이 크롤러의 접근을 차단하기 때문입니다. URL을 입력하면 이 검사 도구는 구글이 사용하는 모든 신호(robots.txt, meta robots, X-Robots-Tag 헤더, 정상화된 목표 URL, HTTP 상태 등)를 평가하여 해당 페이지가 인덱싱 가능한지 여부와 그 이유, 그리고 인덱싱 불가능한 경우 수정해야 할 사항을 알려줍니다.

인덱스화 가능성을 확인하는 방법

  1. 1

    URL을 입력하세요

    체커는 구글봇과 동일하게 URL을 가져옵니다.

  2. 2

    리디렉션을 해결합니다.

    301/302 호프로 구성된 링크 체인이 추적되었으며, 최종 URL이 평가된 값입니다.

  3. 3

    모든 인덱스화 가능 신호를 읽습니다.

    robots.txt 규칙, 메타 로봇, X-Robots 태그, 공식 형태, 상태 코드.

  4. 4

    판결 및 그 이유

    인덱스화 가능/비가능/부분적으로, 판결을 초래한 정확한 신호와 함께.

인덱스화 가능성 신호 및 그 우선순위

구글은 일련의 신호들을 특정 순서에 따라 평가하며, 이 체인 내에서 단 하나의 음성 신호만으로도 인덱싱이 차단될 수 있습니다.

신호 평가 순서

  1. HTTP 상태: 2xx가 필수입니다. 3xx 체인은 따릅니다; 4xx 및 5xx는 인덱싱을 종료합니다.
  2. robots.txt: 해당 URL이 Googlebot에 사용이 금지되어 있는 경우, 해당 페이지는 결코 크롤링되지 않으며, 이로 인해 그 페이지에 포함된 noindex 태그도 전혀 검색되지 않습니다.
  3. X-Robots 태그 헤더: HTTP 응답 헤더 내의 noindex 태그는 인덱싱을 차단합니다.
  4. 메타 로봇: <meta name="robots" content="noindex">는 인덱싱을 차단합니다.
  5. 표준 형태: 다른 곳으로 가는 표준적인 포인팅은 구글이 해당 URL을 인덱싱한다는 의미입니다.
  6. 콘텐츠의 질 및 중복 검출: 구글은 명시적인 지시 없이도 인덱싱을 생략할 수 있습니다.

이 기능이 탐지하는 흔한 오류들

문제 원인
전체 섹션은 인덱싱되지 않았습니다 robots.txt 파일 내 Disallow: 규칙
특정 페이지는 인덱싱되지 않았습니다 메타 로봇에서의 noindex
잘못된 URL로 인덱싱됨 캐노닉얼은 다른 위치에 존재합니다
5xx에서 정지 서버 오류로 크롤이 중단되었습니다
금지 기능과 noindex 태그 간의 충돌 Robots.txt 파일이 크롤링을 차단하며, noindex 태그는 전혀 처리되지 않음
생산 라인으로의 누출 단계 전달 테스트 환경에서 남은 X-Robots-Tag: noindex

robots.txt 파일 내 noindex 항목이 설정된 함정

만약 robots.txt에 Disallow:라는 URL을 지정했다면 구글은 해당 URL을 크롤링하지 않으므로 noindex 태그를 전혀 인식하지 못합니다. 이 URL은 검색 결과에서 설명 없이 단순히 URL만 포함된 ‘빈’ 항목으로 표시될 수 있습니다. URL을 정상적으로 인덱스에서 제거하려면 크롤링을 허용하고 noindex를 사용한 후, 구글이 해당 URL을 인덱스에서 제거한 이후에야 크롤링을 차단해야 합니다.

구글봇의 관점에서의 테스트

체커는 구글봇 사용자 에이전트에 해당 정보를 전송하여 서버 측에서 사용하는 “크롤러는 X만 확인 가능”이라는 기법들이 명확히 드러나도록 합니다. 항상 스테이징 환경이 아닌 실제 운영 환경의 URL을 반드시 확인해야 합니다.

자주 묻는 질문

인덱스링이 가능하다는 것은 단지 기술적인 장애가 없음을 의미할 뿐이며, 반드시 인덱싱이 이루어진다는 보장은 아닙니다. 구글은 콘텐츠의 질, 중복 콘텐츠 여부 및 크롤 예산 등을 고려하여 판단을 내립니다. 구글로부터 확실한 답변을 얻으려면 Search Console의 URL 검사 기능을 사용하시기 바랍니다.

일반적으로는 메타 로봇(또는 X-Robots-Tag)만 사용하는 것이 적절합니다. robots.txt 파일은 크롤링을 차단하며, meta robots 태그는 인덱싱을 차단합니다. 인덱싱을 원하지 않는 페이지의 경우 크롤링을 허용하여 구글이 noindex 태그를 정확히 인식할 수 있도록 해야 합니다.

구글은 리디렉션 체인의 최종 목적지를 평가합니다. A에서 B로의 301 리디렉션의 경우, 구글은 결국 B를 인덱싱하며 A는 인덱싱되지 않습니다. 검사 시스템은 평가 전에 모든 리디렉션을 처리함으로써 이러한 동작을 시뮬레이션합니다.

인증이 필요한 페이지는 본질적으로 인덱싱이 불가능합니다. 이러한 페이지에 SEO를 적용할 필요가 있다면 공개 예비 버전을 고려해 보세요.

관련 도구

이 도구는 다른 언어로도 제공됩니다