0

Robots.txt-tester

Lim inn en robots.txt-fil, velg en crawler – inkludert GPTBot, ClaudeBot og Google-Extended – og se umiddelbart om den kan hente en gitt URL-bane, med den nøyaktige regelen og linjenummeret som avgjorde det.

Buy Me a Coffee at ko-fi.com
Behandler... 0%
Parsing robots.txt
Samsvarende crawler-regler
Ferdig

Resultat

En robots.txt-fil er villedende enkel å lese og overraskende lett å ta feil: en bortkommen `Disallow: /` under feil User-agent-gruppe kan stille deindeksering av et helt nettsted, mens en regel som ser ut som den blokkerer en crawler kan overstyres av et lengre, mer spesifikt mønster andre steder i filen. Dette verktøyet reimplementerer den faktiske matchende algoritmen som søkemotorer og AI-søkeroboter bruker – de-facto Robots Exclusion Protocol formalisert i RFC 9309 og dokumentert av Google – i stedet for å tilnærme den med en enkel linje-for-linje-skanning, så dommen du ser her er dommen en ekte crawler ville beregnet.

Lim inn robots.txt-innholdet ditt, skriv inn URL-banen du vil sjekke (som `/admin/` eller `/blog/draft-post`), og velg en crawler fra en samlet liste med 20 ekte user-agent-tokens. Denne listen går med vilje utover klassikerne – Googlebot, Bingbot og «*»-alternativet – for å inkludere den nåværende generasjonen av AI-skrapere: GPTBot og OAI-SearchBot (OpenAI), ClaudeBot og anthropic-ai (Anthropic), Google-Extended (Googles AI-opplæringssignal for bortvelging av AI-opplæring, atskilt fra Google-Ex-søkeroboter tilsvarende Applebots), opt-out), PerplexityBot, CCBot (Common Crawl, hvis arkiv mater mange andre AI-modeller), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot og mer. Hvert token leveres med en kort, ærlig forklaring på hva det faktisk er.

Algoritmen i seg selv følger spesifikasjonen nøyaktig: brukeragentgrupper matches ufølsomt for store og små bokstaver, med et eksakt samsvar eller prefiksmatch på produkttokenet som alltid slår "*"-reservegruppen, og flere blokker som erklærer det samme tokenet slås sammen som ekte crawlere. Innenfor den vinnende gruppen kontrolleres hver Tillat og Ikke tillat-regel mot banen ved å bruke riktig jokertegn-semantikk (`*` samsvarer med en hvilken som helst sekvens, et etterfølgende `$` anker til slutten av banen), og det lengste samsvarende mønsteret vinner – med en Tillat vinner uavgjort mot en Disallow av lik lengde, nøyaktig som dokumentert av Googles egen robots.txt-implementering.

Resultatpanelet sier ikke bare TILLATT eller BLOKKERT – det navngir den nøyaktige linjen og regelteksten som er ansvarlig, slik at du kan gå rett tilbake til filen din og fikse (eller bekrefte) direktivet som betyr noe. Det er detaljen de fleste robots.txt-kontrollere hopper over, og det er forskjellen mellom å gjette hvorfor en side ikke blir gjennomsøkt og å vite sikkert.