0

Robots.txt-tester

Plak een robots.txt-bestand, kies een crawler (inclusief GPTBot, ClaudeBot en Google-Extended) en kijk meteen of deze een bepaald URL-pad kan ophalen, met de exacte regel en het regelnummer dat dit heeft bepaald.

Buy Me a Coffee at ko-fi.com
Verwerken... 0%
Robots.txt parseren
Overeenkomende crawlerregels
Klaar

Resultaat

Een robots.txt-bestand is bedrieglijk eenvoudig te lezen en verrassend gemakkelijk om fout te gaan: een verdwaalde `Disallow: /` onder de verkeerde User-agent-groep kan stilletjes een hele site de-indexeren, terwijl een regel die eruitziet alsof hij een crawler blokkeert, kan worden overschreven door een langer, specifieker patroon elders in het bestand. Deze tool implementeert het daadwerkelijke matching-algoritme dat zoekmachines en AI-crawlers gebruiken opnieuw - het de facto Robots Exclusion Protocol geformaliseerd in RFC 9309 en gedocumenteerd door Google - in plaats van het te benaderen met een eenvoudige regel-voor-regel scan, dus het oordeel dat u hier ziet is het oordeel dat een echte crawler zou berekenen.

Plak uw robots.txt-inhoud, typ het URL-pad dat u wilt controleren (zoals `/admin/` of `/blog/draft-post`) en kies een crawler uit een gebundelde lijst van 20 echte user-agent-tokens. Die lijst gaat doelbewust verder dan de klassiekers – Googlebot, Bingbot en de ‘*` fallback – en omvat ook de huidige generatie AI-scrapers: GPTBot en OAI-SearchBot (OpenAI), ClaudeBot en anthropic-ai (Anthropic), Google-Extended (het opt-outsignaal van Google voor AI-training, los van de zoekcrawler van Googlebot), Applebot-Extended (de equivalente opt-out van Apple), PerplexityBot, CCBot (Common Crawl, waarvan het archief vele andere AI-modellen voedt), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot en meer. Elk token wordt geleverd met een korte, eerlijke uitleg van wat het eigenlijk is.

Het algoritme zelf volgt de specificatie nauwkeurig: gebruikers-agentgroepen worden hoofdletterongevoelig gematcht, waarbij een exacte overeenkomst of een voorvoegselovereenkomst op het producttoken altijd de '*` fallback-groep verslaat, en meerdere blokken die hetzelfde token declareren worden samengevoegd zoals echte crawlers dat doen. Binnen de winnende groep wordt elke Toestaan- en Niet-toestaan-regel vergeleken met het pad met behulp van de juiste wildcard-semantiek (`*` komt overeen met elke reeks, een achterliggende `$` verankert aan het einde van het pad), en het langst overeenkomende patroon wint - met een Toestaan ​​om gelijkspel te winnen tegen een Disallow van gelijke lengte, precies zoals gedocumenteerd door Google's eigen robots.txt-implementatie.

Het resultatenpaneel zegt niet alleen TOEGESTAAN of GEBLOKKEERD; het vermeldt de exacte regel en regeltekst die verantwoordelijk is, zodat u direct terug kunt gaan naar uw bestand en de richtlijn die er toe doet, kunt corrigeren (of bevestigen). Dat is het detail dat de meeste robots.txt-checkers overslaan, en het is het verschil tussen raden waarom een ​​pagina niet wordt gecrawld en het zeker weten.