Robots.txt 생성기

대상으로 하는 크롤러를 설정하고 차단할 경로와 허용할 경로를 나열하고 선택적으로 crawl-delay를 추가한 뒤 사이트맵을 지정하면, 생성기가 올바르게 형식화된 robots.txt를 조립해 복사하고 배포할 수 있게 해줍니다. 정확한 줄 형식과 문장 부호를 처리해 주므로 구문이나 user-agent 철자를 외울 필요가 없습니다.

파일을 생성하는 방법

  1. 1

    user-agent 설정

    규칙이 적용될 크롤러를 입력하거나, 모든 봇을 대상으로 하려면 *를 그대로 두세요.

  2. 2

    차단할 경로 나열

    차단할 디렉터리나 경로를 한 줄에 하나씩 추가하세요(예: /admin/ 또는 /checkout/).

  3. 3

    허용할 경로 나열

    크롤 가능한 상태로 두어야 할 경로를 한 줄에 하나씩 추가해, 더 넓은 Disallow 안에서 예외를 만드세요.

  4. 4

    사이트맵과 crawl-delay 추가

    사이트맵 URL을 선언하고, 필요하면 crawl-delay를 초 단위로 지정하세요.

  5. 5

    복사 및 배포

    생성된 파일을 복사해 https://yourdomain.com/robots.txt에 두세요. 하위 디렉터리가 아니라 루트에만 둡니다.

일반적인 시작 템플릿

모두 허용(대부분의 사이트):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

staging / 관리자 페이지 차단:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

AI 학습 크롤러 차단, 검색 엔진 허용:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

알아두면 좋은 user-agent

User-agent 소유자 용도
Googlebot Google Search 웹 색인
Googlebot-Image Google 이미지 검색
Google-Extended Google Bard/Gemini 학습(옵트아웃 가능)
Bingbot Microsoft Bing 검색
DuckDuckBot DuckDuckGo DDG 검색
GPTBot OpenAI ChatGPT / 학습(옵트아웃 가능)
ClaudeBot Anthropic Claude 학습(옵트아웃 가능)
CCBot Common Crawl 많은 LLM이 사용하는 코퍼스
AhrefsBot Ahrefs SEO 백링크 색인
SemrushBot Semrush SEO 리서치
MJ12bot Majestic SEO 리서치

AI 학습 봇은 법적 의무가 아니라 관행상 옵트아웃 방식입니다. 선의의 운영자는 이 지침을 준수하지만, 그렇지 않은 운영자는 준수하지 않습니다.

경로 매칭 규칙

  • 경로는 도메인 루트를 기준으로 하며 /로 시작합니다.
  • *는 임의의 문자와 일치합니다. Disallow: /*.pdf$는 모든 PDF를 차단합니다.
  • $는 URL 끝에 고정됩니다. Disallow: /*/trash$/foo/trash를 차단하지만 /foo/trashes/...는 차단하지 않습니다.
  • 가장 긴 일치가 우선합니다. 해당 하위 경로에서는 Allow: /admin/public/Disallow: /admin/를 재정의합니다.
  • 경로는 대소문자를 구분합니다.

robots.txt로 할 수 없는 것

  • Google에서 페이지 삭제. 페이지 자체에 noindex 메타 태그를 사용하세요.
  • 사람으로부터 URL 보호. robots.txt는 공개이며, 준수하는 봇에 대한 제안일 뿐입니다.
  • Googlebot 크롤 속도 제한. Crawl-delay는 Google이 무시합니다. Search Console을 사용하세요.
  • robots.txt를 무시하는 봇 차단. 스팸 스크래퍼는 이 파일을 읽지 않습니다.

배포 체크리스트

  1. https://yourdomain.com/robots.txt에 두세요. 루트에만 둡니다.
  2. Content-Type: text/plain으로 제공하세요(대부분의 서버가 자동으로 처리합니다).
  3. 크기: 500KB 미만. Google은 더 큰 파일을 잘라냅니다.
  4. 배포 후 Google Search Console의 robots.txt 테스터에서 가져온 파일을 확인하세요.
  5. Disallow를 제거할 때 색인 해제에 몇 주가 걸릴 수 있음에 유의하세요.

자주 묻는 질문

반드시는 아닙니다. 없으면 크롤러는 “모두 허용”으로 간주합니다. staging, 관리자, 결제, 내부 검색 등 차단할 것이 있다면 필요합니다.

GPTBot, ClaudeBot, CCBot, Google-Extended 같은 user-agent 블록으로 중단을 요청할 수 있습니다. 주요 운영자는 이를 준수하지만, 성실하지 않은 스크래퍼는 완전히 무시합니다.

크롤러는 관대해서 알 수 없는 지시문은 무시합니다. 심각한 오류(HTTP 404 또는 500)는 “모두 허용”으로 처리됩니다. 배포 전에 파일을 검증하세요.

커버하려는 각 호스트의 루트에 둡니다. https://www.example.com/robots.txthttps://example.com/robots.txt는 서로 다른 호스트를 위한 별도의 파일입니다.

아니요. 입력한 경로는 파일을 조립하는 데만 사용되며 저장되거나 기록되지 않습니다.

관련 도구

이 도구는 다른 언어로도 제공됩니다