Robots.txt 검사기

robots.txt 규칙과 확인하려는 URL 경로를 붙여넣으면, 검사기가 Allow와 Disallow 줄을 읽어 해당 경로가 차단되는지 허용되는지 알려줍니다. 어떤 페이지가 갑자기 구글에서 사라졌을 때 지나치게 엄격한 Disallow가 원인인지 확인하거나, 새 규칙을 작성한 뒤 파일을 배포하기 전에 경로를 검증할 때 유용합니다.

검사기 동작 방식

  1. 1

    규칙 붙여넣기

    robots.txt의 Allow와 Disallow 줄을 입력란에 복사하거나, 새 규칙을 작성해 시험해 보세요.

  2. 2

    테스트할 경로 입력

    확인하려는 URL 경로를 입력하세요(예: /private/page). 전체 도메인이 아니라 경로만 사용하세요.

  3. 3

    규칙 확인

    검사기가 Allow와 Disallow 줄을 살펴보고 입력한 경로에 일치하는 규칙을 찾습니다.

  4. 4

    결과 확인

    찾은 규칙 수, 테스트한 경로, 그리고 판정(기본 허용, Disallow에 의한 차단, 또는 Allow에 의한 허용)을 보여줍니다.

최소한의 올바른 robots.txt

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: *. 다른 블록에 명시적으로 지정되지 않은 모든 크롤러에 적용됩니다.
  • Allow: /. 기본적으로 모두 허용.
  • Disallow: /admin/. admin 디렉터리는 접근 금지.
  • Sitemap:. 검색 엔진에 XML 사이트맵 위치를 알려줍니다.

Googlebot이 실제로 따르는 규칙

구글의 파서는 모호한 규칙을 해석하는 사실상의 표준입니다:

  • 대소문자 구분 경로. /Admin//admin/은 다릅니다.
  • 가장 긴 일치가 승리. /admin/public/으로 시작하는 URL에 대해 Allow: /admin/public/Disallow: /admin/을 이깁니다.
  • 와일드카드. *는 임의의 문자 시퀀스와 일치하고, $는 URL의 끝에 고정됩니다.
  • 주석#로 시작합니다.
  • 순서 무관. 규칙은 나열 순서가 아니라 구체성(경로 길이)으로 평가됩니다.

흔한 실수

실수 영향
상단에 Disallow: /, Allow 없음 사이트 전체 차단
Disallow: *.pdf 많은 파서가 무시, Disallow: /*.pdf$ 사용
Disallow에 프로토콜 상대 또는 절대 URL 무시됨, 경로는 상대여야 함
규칙 앞에 여러 User-agent 결합됨; 규칙이 나열된 모든 UA에 적용
경로의 후행 공백 조용히 다른 경로로 취급
robots.txt를 하위 디렉터리에 둠 루트 도메인 파일만 가져옴

robots.txt vs noindex

robots.txt는 크롤러에게 URL을 가져오지 말라고 합니다. 이미 색인된 페이지를 robots.txt로 차단하면 몇 달간 색인에 남을 수 있습니다, 크롤러가 제거를 확인하려 가져올 수 없기 때문입니다. 색인에서 빼려면 페이지 자체에 noindex 메타 태그나 HTTP 헤더를 두고 크롤러가 보게 하세요.

Crawl-delay

Crawl-delay: 10은 요청 사이 10초를 요청합니다. 구글은 이를 무시합니다(크롤 속도는 Search Console에서 설정). Bing, Yandex, 일부 틈새 크롤러는 존중합니다. 틈새 봇의 크롤 압박을 받는 작은 사이트에 쓰세요.

Disallow가 하지 않는 일

  • 링크되는 것을 막음. 다른 사이트가 차단된 URL로 여전히 링크할 수 있고, 그 URL은 제목·설명 없이 URL만으로 검색 결과에 나타납니다.
  • 페이지 렌더링 방지. 사용자는 Disallow된 URL을 여전히 방문할 수 있습니다.
  • URL을 세상에서 숨김. robots.txt는 공개입니다. 비밀 경로를 거기 나열하면 그것을 광고하는 셈입니다.

자주 묻는 질문

disallow는 색인이 아니라 크롤링을 막기 때문입니다. 구글이 이미 URL을 알고 있으면(링크나 사이트맵에서) 검색 결과에 맨 URL을 남길 수 있습니다. 페이지에 noindex 태그를 두고 구글이 가져와 제거를 확인하게 하세요.

네. 자체 규칙을 가진 User-agent: BadBot 블록을 사용하세요. 단, 행실이 나쁜 봇은 robots.txt를 아예 무시합니다. 준수하는 봇만 존중합니다.

아니요. robots.txt는 공개입니다: 나열하면 위치를 광고합니다. 대신 인증과 서버 수준 접근 제어를 사용하세요.

네, 경로에 대해서는요. Disallow: /Admin//admin/을 차단하지 않습니다. URL의 실제 대소문자를 맞추세요.

네. 별도의 XML 사이트맵이나 사이트맵 인덱스를 가리키도록 여러 Sitemap: 줄을 나열하세요.

관련 도구

이 도구는 다른 언어로도 제공됩니다