0

Robots.txt 테스터

robots.txt 파일을 붙여 넣고 GPTBot, ClaudeBot, Google-Extended를 포함한 크롤러를 선택하세요. 특정 URL 경로를 가져올 수 있는지 여부와 함께, 결과를 결정한 정확한 규칙과 줄 번호를 즉시 확인할 수 있습니다.

🔒 전적으로 귀하의 브라우저에서 처리됩니다. 여기에 입력하는 어떤 것도 업로드되지 않습니다.

처리 중... 0%
robots.txt 파싱 중
크롤러 규칙 매칭 중
완료

결과

robots.txt 파일은 읽기는 겉보기엔 간단하지만, 잘못 작성하기도 아주 쉽습니다. 잘못된 User-agent 그룹 아래에 들어간 `Disallow: /` 한 줄이 사이트 전체의 색인을 조용히 삭제할 수 있고, 특정 크롤러를 차단하는 것처럼 보이는 규칙이 파일 내 다른 더 길고 구체적인 패턴에 의해 무효화될 수도 있습니다. 이 도구는 검색 엔진과 AI 크롤러가 실제로 사용하는 매칭 알고리즘, 즉 RFC 9309로 공식화되고 Google이 문서화한 사실상의 Robots Exclusion Protocol(REP)을 단순한 줄 단위 검사로 근사하는 대신 그대로 다시 구현했습니다. 따라서 여기서 보는 결과는 실제 크롤러가 계산해 낼 결과와 같습니다.

robots.txt 내용을 붙여 넣고, 확인하려는 URL 경로(예: `/admin/` 또는 `/blog/draft-post`)를 입력한 다음, 내장된 20개의 실제 User-agent 토큰 목록에서 크롤러를 선택하세요. 이 목록에는 Googlebot, Bingbot, `*` 대체 토큰과 같은 전통적인 크롤러 외에 현세대 AI 스크레이퍼들이 의도적으로 포함되어 있습니다. GPTBot과 OAI-SearchBot(OpenAI), ClaudeBot과 anthropic-ai(Anthropic), Google-Extended(Googlebot 검색 크롤러와는 별개인 Google의 AI 학습 차단 신호), Applebot-Extended(이에 대응하는 Apple의 차단 신호), PerplexityBot, CCBot(그 아카이브가 다른 많은 AI 모델에 피드로 사용되는 Common Crawl), Bytespider(ByteDance), Meta-ExternalAgent, Amazonbot 등이 이에 해당합니다. 모든 토큰에는 그것이 실제로 무엇인지에 대한 짧고 솔직한 설명이 함께 제공됩니다.

알고리즘 자체는 명세를 정확히 따릅니다. User-agent 그룹은 대소문자를 구분하지 않고 매칭되며, 제품 토큰에 대한 완전 일치 또는 접두사 일치는 항상 `*` 대체 그룹보다 우선하고, 동일한 토큰을 선언하는 여러 블록은 실제 크롤러가 그러하듯 병합됩니다. 선택된 그룹 내에서 모든 Allow 및 Disallow 규칙은 적절한 와일드카드 의미 체계(`*`는 임의의 시퀀스와 일치, 뒤따르는 `$`는 경로 끝에 고정)를 사용하여 경로와 대조되며, 가장 긴 패턴이 우선합니다. 길이가 동일한 경우 Google의 자체 robots.txt 구현에 문서화된 그대로 Allow가 Disallow보다 우선합니다.

결과 패널은 단순히 허용됨 또는 차단됨이라고만 표시하지 않고, 결과를 결정한 정확한 줄과 규칙 텍스트를 알려 주므로, 파일에서 바로 문제가 되는(또는 의도한 대로 작동하는) 부분을 찾아 수정할 수 있습니다. 이는 대부분의 robots.txt 검사기가 건너뛰는 세부 사항이며, 페이지가 크롤링되지 않는 이유를 추측하는 것과 확실히 아는 것의 차이입니다.