Robots.txt-tester
Indsæt en robots.txt-fil, vælg en crawler – herunder GPTBot, ClaudeBot og Google-Extended – og se øjeblikkeligt, om den må hente en given URL-sti, med den præcise regel og linje, der afgjorde det.
🔒 Behandles helt i din browser - intet, du indtaster her, bliver nogensinde uploadet.
Resultat
En robots.txt-fil er bedragerisk nem at læse og overraskende nem at tage fejl af: en enkelt vildfaren `Disallow: /` under den forkerte User-agent-gruppe kan lydløst afindeksere et helt site, mens en regel, der ser ud som om den blokerer en crawler, kan blive tilsidesat af et længere, mere specifikt mønster et andet sted i filen. Dette værktøj genimplementerer den faktiske matching-algoritme, som søgemaskiner og AI-crawlere bruger – den de facto Robots Exclusion Protocol, formaliseret i RFC 9309 og dokumenteret af Google – i stedet for at approksimere den med en simpel linje-for-linje-skanning, så den dom, du ser her, er den dom, en ægte crawler ville beregne.
Indsæt indholdet af din robots.txt, skriv URL-stien, du vil tjekke (f.eks. `/admin/` eller `/blog/draft-post`), og vælg en crawler fra en medfølgende liste med 20 ægte brugeragent-tokens. Listen går bevidst ud over klassikerne – Googlebot, Bingbot og `*`-fallbacken – for at inkludere den nuværende generation af AI-skrabere: GPTBot og OAI-SearchBot (OpenAI), ClaudeBot og anthropic-ai (Anthropic), Google-Extended (Googles opt-out-signal for AI-træning, adskilt fra Googlebots søgecrawler), Applebot-Extended (Apples tilsvarende opt-out), PerplexityBot, CCBot (Common Crawl, hvis arkiv føder mange andre AI-modeller), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot med flere. Hvert token leveres med en kort, ærlig forklaring på, hvad det rent faktisk er.
Selve algoritmen følger specifikationen præcist: user-agent-grupper matches versalfølsomt, hvor et eksakt eller præfiksmatch på produkt-tokenet altid slår `*`-fallback-gruppen, og flere blokke, der angiver det samme token, flettes, som ægte crawlere gør. Inden for den vindende gruppe tjekkes hver Allow- og Disallow-regel mod stien ved hjælp af korrekt jokertegnssemantik (`*` matcher enhver sekvens, et afsluttende `$` forankrer til stiens slutning), og det længste matchende mønster vinder – hvor en Allow vinder enhver uafgjort mod en Disallow af samme længde, præcis som dokumenteret af Googles egen robots.txt-implementering.
Resultatpanelet siger ikke bare TILLADT eller BLOKERET – det angiver den nøjagtige linje og regeltekst, der er ansvarlig, så du kan gå direkte tilbage til din fil og rette (eller bekræfte) det direktiv, der betyder noget. Det er detaljen, de fleste robots.txt-tjekkere springer over, og det er forskellen mellem at gætte på, hvorfor en side ikke bliver crawlet, og at vide det med sikkerhed.