0

Robots.txt 테스터

robots.txt 파일을 붙여넣고 GPTBot, ClaudeBot 및 Google-Extended를 포함한 크롤러를 선택하면 이를 결정한 정확한 규칙과 줄 번호를 사용하여 특정 URL 경로를 가져올 수 있는지 즉시 확인할 수 있습니다.

Buy Me a Coffee at ko-fi.com
처리 중... 0%
robots.txt 구문 분석
일치하는 크롤러 규칙
완료

결과

robots.txt 파일은 믿을 수 없을 정도로 읽기 쉽고 놀라울 정도로 잘못되기 쉽습니다. 잘못된 User-agent 그룹 아래에 있는 'Disallow: /'는 자동으로 전체 사이트의 색인을 해제할 수 있는 반면, 크롤러를 차단하는 것처럼 보이는 규칙은 파일의 다른 곳에서 더 길고 더 구체적인 패턴으로 재정의될 수 있습니다. 이 도구는 간단한 한 줄씩 스캔하여 근사치를 계산하는 대신 RFC 9309에서 공식화되고 Google에서 문서화한 실제 일치 알고리즘 검색 엔진과 AI 크롤러가 사용하는 사실상의 로봇 제외 프로토콜을 다시 구현하므로 여기에 표시되는 결과는 실제 크롤러가 계산하는 결과입니다.

robots.txt 콘텐츠를 붙여넣고 확인하려는 URL 경로(예: `/admin/` 또는 `/blog/draft-post`)를 입력한 다음 20개의 실제 사용자 에이전트 토큰 번들 목록에서 크롤러를 선택하세요. 이 목록은 의도적으로 기존의 Googlebot, Bingbot 및 `*` 폴백을 넘어서 현재 세대의 AI 스크레이퍼인 GPTBot 및 OAI-SearchBot(OpenAI), ClaudeBot 및 anthropic-ai(Anthropic), Google-Extended(Googlebot의 검색 크롤러와 별개인 Google의 AI 훈련 거부 신호), Applebot-Extended(Apple의 동등한 거부), PerplexityBot, CCBot(다른 많은 AI 모델에 피드를 제공하는 Common Crawl), Bytespider(ByteDance), Meta-ExternalAgent, Amazonbot 등. 모든 토큰은 그것이 실제로 무엇인지에 대한 짧고 정직한 설명과 함께 배송됩니다.

알고리즘 자체는 사양을 정확하게 따릅니다. 사용자 에이전트 그룹은 대소문자를 구분하지 않고 일치하며, 제품 토큰의 정확한 일치 또는 접두사 일치는 항상 `*` 대체 그룹을 능가하며, 동일한 토큰을 선언하는 여러 블록은 실제 크롤러처럼 병합됩니다. 승리한 그룹 내에서 모든 Allow 및 Disallow 규칙은 적절한 와일드카드 의미를 사용하여 경로에 대해 검사됩니다(`*`는 모든 시퀀스와 일치하고 후행 `$`는 경로 끝에 고정됩니다). 그리고 가장 긴 일치 패턴이 승리합니다. 이는 Google의 자체 robots.txt 구현에 문서화된 것과 정확히 일치하며 동일한 길이의 Disallow에 대해 허용이 승리합니다.

결과 패널에는 ALLOWED 또는 BLOCKED만 표시되는 것이 아닙니다. 정확한 행과 규칙 텍스트의 이름이 표시되므로 파일로 바로 돌아가서 중요한 지시문을 수정(또는 확인할)할 수 있습니다. 이는 대부분의 robots.txt 검사기가 건너뛰는 세부 사항이며, 페이지가 크롤링되지 않는 이유를 추측하는 것과 확실하게 아는 것의 차이입니다.