0

Robots.txt Tester

Indsæt en robots.txt-fil, vælg en crawler - inklusive GPTBot, ClaudeBot og Google-Extended - og se øjeblikkeligt, om den kan hente en given URL-sti med den nøjagtige regel og linjenummer, der afgjorde det.

Buy Me a Coffee at ko-fi.com
Behandler... 0%
Parsing af robots.txt
Matchende crawler-regler
Færdig

Resultat

En robots.txt-fil er vildledende nem at læse og overraskende let at tage fejl af: en omstrejfende `Disallow: /` under den forkerte User-agent-gruppe kan lydløst deindeksere et helt websted, mens en regel, der ser ud til at blokere en crawler, kan tilsidesættes af et længere, mere specifikt mønster et andet sted i filen. Dette værktøj genimplementerer den faktiske matchende algoritme, søgemaskiner og AI-crawlere bruger - de-facto Robots Exclusion Protocol formaliseret i RFC 9309 og dokumenteret af Google - snarere end at tilnærme den med en simpel linje-for-linje-scanning, så den dom, du ser her, er den dom, en rigtig crawler ville beregne.

Indsæt dit robots.txt-indhold, skriv den URL-sti, du vil tjekke (som `/admin/` eller `/blog/draft-post`), og vælg en crawler fra en samlet liste med 20 rigtige brugeragent-tokens. Denne liste går med vilje ud over klassikerne - Googlebot, Bingbot og "*"-tilbagefaldet - for at inkludere den nuværende generation af AI-skrabere: GPTBot og OAI-SearchBot (OpenAI), ClaudeBot og anthropic-ai (Anthropic), Google-Extended (Googles AI-træningsopt-out-signal, adskilt fra Google-bot-søgnings-crawler-ækvivalenter), opt-out), PerplexityBot, CCBot (Common Crawl, hvis arkiv leverer mange andre AI-modeller), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot og mere. Hver token leveres med en kort, ærlig forklaring på, hvad det faktisk er.

Selve algoritmen følger specifikationerne præcist: bruger-agent-grupper matches uafhængigt af store og små bogstaver, hvor et nøjagtigt eller præfiks-match på produkttokenet altid slår "*"-faldback-gruppen, og flere blokke, der erklærer det samme token, flettes som rigtige crawlere gør. Inden for den vindende gruppe kontrolleres hver Allow and Disallow-regel mod stien ved hjælp af korrekt wildcard-semantik (`*` matcher enhver sekvens, et efterfølgende `$` ankre til slutningen af ​​stien), og det længste matchende mønster vinder - med en Tillad, der vinder uafgjort mod en Disallow af samme længde, nøjagtigt som dokumenteret af Googles egen robots.txt-implementering.

Resultatpanelet siger ikke bare TILLADET eller BLOKERET - det navngiver den nøjagtige linje og regeltekst, der er ansvarlig, så du kan gå direkte tilbage til din fil og rette (eller bekræfte) det direktiv, der betyder noget. Det er den detalje, de fleste robots.txt-tjekkere springer over, og det er forskellen mellem at gætte, hvorfor en side ikke bliver crawlet, og at vide det med sikkerhed.