0

Robots.txt-tester

Plak een robots.txt-bestand, kies een crawler — waaronder GPTBot, ClaudeBot en Google-Extended — en zie direct of een opgegeven URL-pad mag worden opgehaald, met de exacte regel en het regelnummer die de doorslag gaven.

🔒 Wordt volledig in uw browser verwerkt. Niets wat u hier invoert, wordt ooit geüpload.

Verwerken... 0%
Robots.txt parsen
Crawlerregels matchen
Klaar

Resultaat

Een robots.txt-bestand lijkt bedrieglijk eenvoudig te lezen en is verrassend makkelijk verkeerd te doen: een losse `Disallow: /` onder de verkeerde User-agent-groep kan stilletjes een hele site uit de index halen, terwijl een regel die een crawler lijkt te blokkeren kan worden overruled door een langer, specifieker patroon elders in het bestand. Deze tool implementeert het echte matchingsalgoritme dat zoekmachines en AI-crawlers gebruiken — het de facto Robots Exclusion Protocol vastgelegd in RFC 9309 en gedocumenteerd door Google — in plaats van het te benaderen met een simpele regel-voor-regel scan, zodat de uitslag die je hier ziet de uitslag is die een echte crawler zou berekenen.

Plak je robots.txt-inhoud, typ het URL-pad dat je wilt controleren (zoals `/admin/` of `/blog/concept-post`) en kies een crawler uit een gebundelde lijst met 20 echte user-agenttokens. Die lijst gaat bewust verder dan de klassiekers — Googlebot, Bingbot en de `*`-fallback — en bevat de huidige generatie AI-scrapers: GPTBot en OAI-SearchBot (OpenAI), ClaudeBot en anthropic-ai (Anthropic), Google-Extended (Google's opt-outsignaal voor AI-training, gescheiden van Googlebots zoekcrawler), Applebot-Extended (Apple's equivalente opt-out), PerplexityBot, CCBot (Common Crawl, wiens archief veel andere AI-modellen voedt), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot en meer. Elk token gaat vergezeld van een korte, eerlijke uitleg van wat het eigenlijk is.

Het algoritme zelf volgt de specificatie precies: user-agentgroepen worden hoofdletterongevoelig gematcht, waarbij een exacte of prefix-match op de producttoken altijd de `*`-fallbackgroep verslaat, en meerdere blokken die dezelfde token declareren worden samengevoegd zoals echte crawlers doen. Binnen de winnende groep wordt elke Allow- en Disallow-regel tegen het pad gecontroleerd met de juiste wildcard-semantiek (`*` komt overeen met elke reeks, een afsluitende `$` verankert aan het einde van het pad), en het langste overeenkomende patroon wint — waarbij een Allow elke gelijkspel wint van een Disallow van gelijke lengte, precies zoals gedocumenteerd door Google's eigen robots.txt-implementatie.

Het resultaatvenster zegt niet alleen TOEGESTAAN of GEBLOKKEERD — het noemt de exacte regel en regelinstructie die verantwoordelijk is, zodat je direct terug kunt naar je bestand om de bepalende directive te repareren (of te bevestigen). Dat is het detail dat de meeste robots.txt-checkers overslaan, en het is het verschil tussen gissen waarom een pagina niet wordt gecrawld en het zeker weten.