Robots.txt 검사기
robots.txt 규칙과 확인하려는 URL 경로를 붙여넣으면, 검사기가 Allow와 Disallow 줄을 읽어 해당 경로가 차단되는지 허용되는지 알려줍니다. 어떤 페이지가 갑자기 구글에서 사라졌을 때 지나치게 엄격한 Disallow가 원인인지 확인하거나, 새 규칙을 작성한 뒤 파일을 배포하기 전에 경로를 검증할 때 유용합니다.
검사기 동작 방식
-
1
규칙 붙여넣기
robots.txt의 Allow와 Disallow 줄을 입력란에 복사하거나, 새 규칙을 작성해 시험해 보세요.
-
2
테스트할 경로 입력
확인하려는 URL 경로를 입력하세요(예: /private/page). 전체 도메인이 아니라 경로만 사용하세요.
-
3
규칙 확인
검사기가 Allow와 Disallow 줄을 살펴보고 입력한 경로에 일치하는 규칙을 찾습니다.
-
4
결과 확인
찾은 규칙 수, 테스트한 경로, 그리고 판정(기본 허용, Disallow에 의한 차단, 또는 Allow에 의한 허용)을 보여줍니다.
최소한의 올바른 robots.txt
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
- User-agent: *. 다른 블록에 명시적으로 지정되지 않은 모든 크롤러에 적용됩니다.
- Allow: /. 기본적으로 모두 허용.
- Disallow: /admin/. admin 디렉터리는 접근 금지.
- Sitemap:. 검색 엔진에 XML 사이트맵 위치를 알려줍니다.
Googlebot이 실제로 따르는 규칙
구글의 파서는 모호한 규칙을 해석하는 사실상의 표준입니다:
- 대소문자 구분 경로.
/Admin/과/admin/은 다릅니다. - 가장 긴 일치가 승리.
/admin/public/으로 시작하는 URL에 대해Allow: /admin/public/이Disallow: /admin/을 이깁니다. - 와일드카드.
*는 임의의 문자 시퀀스와 일치하고,$는 URL의 끝에 고정됩니다. - 주석은
#로 시작합니다. - 순서 무관. 규칙은 나열 순서가 아니라 구체성(경로 길이)으로 평가됩니다.
흔한 실수
| 실수 | 영향 |
|---|---|
상단에 Disallow: /, Allow 없음 |
사이트 전체 차단 |
Disallow: *.pdf |
많은 파서가 무시, Disallow: /*.pdf$ 사용 |
| Disallow에 프로토콜 상대 또는 절대 URL | 무시됨, 경로는 상대여야 함 |
규칙 앞에 여러 User-agent 줄 |
결합됨; 규칙이 나열된 모든 UA에 적용 |
| 경로의 후행 공백 | 조용히 다른 경로로 취급 |
| robots.txt를 하위 디렉터리에 둠 | 루트 도메인 파일만 가져옴 |
robots.txt vs noindex
robots.txt는 크롤러에게 URL을 가져오지 말라고 합니다. 이미 색인된 페이지를 robots.txt로 차단하면 몇 달간 색인에 남을 수 있습니다, 크롤러가 제거를 확인하려 가져올 수 없기 때문입니다. 색인에서 빼려면 페이지 자체에 noindex 메타 태그나 HTTP 헤더를 두고 크롤러가 보게 하세요.
Crawl-delay
Crawl-delay: 10은 요청 사이 10초를 요청합니다. 구글은 이를 무시합니다(크롤 속도는 Search Console에서 설정). Bing, Yandex, 일부 틈새 크롤러는 존중합니다. 틈새 봇의 크롤 압박을 받는 작은 사이트에 쓰세요.
Disallow가 하지 않는 일
- 링크되는 것을 막음. 다른 사이트가 차단된 URL로 여전히 링크할 수 있고, 그 URL은 제목·설명 없이 URL만으로 검색 결과에 나타납니다.
- 페이지 렌더링 방지. 사용자는 Disallow된 URL을 여전히 방문할 수 있습니다.
- URL을 세상에서 숨김. robots.txt는 공개입니다. 비밀 경로를 거기 나열하면 그것을 광고하는 셈입니다.
자주 묻는 질문
disallow는 색인이 아니라 크롤링을 막기 때문입니다. 구글이 이미 URL을 알고 있으면(링크나 사이트맵에서) 검색 결과에 맨 URL을 남길 수 있습니다. 페이지에 noindex 태그를 두고 구글이 가져와 제거를 확인하게 하세요.
네. 자체 규칙을 가진 User-agent: BadBot 블록을 사용하세요. 단, 행실이 나쁜 봇은 robots.txt를 아예 무시합니다. 준수하는 봇만 존중합니다.
아니요. robots.txt는 공개입니다: 나열하면 위치를 광고합니다. 대신 인증과 서버 수준 접근 제어를 사용하세요.
네, 경로에 대해서는요. Disallow: /Admin/은 /admin/을 차단하지 않습니다. URL의 실제 대소문자를 맞추세요.
네. 별도의 XML 사이트맵이나 사이트맵 인덱스를 가리키도록 여러 Sitemap: 줄을 나열하세요.
관련 도구
외부 링크 추출기
원시 HTML을 붙여넣고 필요에 따라 기본 URL을 지정하면, 코드에 포함된 모든 외부 http/https 링크를 중복 없이 정리된 목록으로 제공합니다. 링크 감사와 SEO 검토에 유용합니다.
FAQ 스키마 생성기
질문과 답변 쌍으로 FAQPage JSON-LD 마크업을 생성해 Google의 리치 결과와 답변 상자 노출 자격을 얻으세요.
hreflang 검사기
붙여 넣은 HTML의 hreflang을 로컬에서 검사합니다. 코드, 전체 URL, 중복, 위치와 선택적 자기 참조를 확인하세요.
HTTP 보안 헤더 검사기
HTTP 응답 헤더를 붙여넣고 HSTS, CSP, 클릭재킹, MIME, 리퍼러, 교차 출처 정책을 브라우저에서 점검하세요.
Google SERP 시뮬레이터
모바일과 데스크톱의 글자 수 제한으로 Google 스타일 검색 스니펫을 대략 확인하세요. 초안은 이 브라우저 세션에만 남습니다.
링크 단축 해독기
bit.ly, t.co, tinyurl 등 단축 링크를 펼칩니다. 클릭하기 전에 모든 리디렉트 홉, 상태 코드, 최종 목적지를 확인하세요.
이 도구는 다른 언어로도 제공됩니다
- Robots.txt-checker [NL]
- Vérificateur de Robots.txt [FR]
- أداة فحص ملف robots.txt [AR]
- Sprawdzanie robots.txt [PL]
- Pemeriksa Robot.txt [ID]
- Robots.txt-Prüfer [DE]
- Verificador de robots.txt [ES]
- เครื่องมือตรวจสอบไฟล์ robots.txt [TH]
- Robots.txtチェッカー [JA]
- Robots.txt-kontroll [SV]
- Trình kiểm tra robots.txt [VI]
- Verificador de Robots.txt [PT]
- Проверка robots.txt [RU]
- Robots.txt Denetleyici [TR]
- Robots.txt 检查器 [ZH]
- Robots.txt Checker [EN]
- Controllore Robots.txt [IT]