Testeur Robots.txt
Collez un fichier robots.txt, choisissez un robot d'exploration (y compris GPTBot, ClaudeBot et Google-Extended) et voyez instantanément s'il peut récupérer un chemin d'URL donné, avec la règle exacte et le numéro de ligne qui l'ont décidé.
Résultat
Un fichier robots.txt est d'une simplicité trompeuse à lire et étonnamment facile à se tromper : un `Disallow: /` égaré sous le mauvais groupe d'agent utilisateur peut désindexer silencieusement un site entier, tandis qu'une règle qui semble bloquer un robot peut être remplacée par un modèle plus long et plus spécifique ailleurs dans le fichier. Cet outil réimplémente l'algorithme de correspondance réel utilisé par les moteurs de recherche et les robots d'exploration IA - le protocole d'exclusion de facto des robots formalisé dans la RFC 9309 et documenté par Google - plutôt que de s'en rapprocher avec une simple analyse ligne par ligne, de sorte que le verdict que vous voyez ici est le verdict qu'un vrai robot d'exploration calculerait.
Collez le contenu de votre robots.txt, tapez le chemin de l'URL que vous souhaitez vérifier (comme « /admin/ » ou « /blog/draft-post ») et choisissez un robot d'exploration dans une liste regroupée de 20 véritables jetons d'agent utilisateur. Cette liste va intentionnellement au-delà des classiques - Googlebot, Bingbot et le repli `*` - pour inclure la génération actuelle de grattoirs d'IA : GPTBot et OAI-SearchBot (OpenAI), ClaudeBot et anthropic-ai (Anthropic), Google-Extended (le signal de désinscription de la formation IA de Google, distinct du robot de recherche de Googlebot), Applebot-Extended (l'équivalent de désinscription d'Apple), PerplexityBot, CCBot. (Common Crawl, dont les archives alimentent de nombreux autres modèles d'IA), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot et plus encore. Chaque jeton est accompagné d’une explication courte et honnête de ce dont il s’agit réellement.
L'algorithme lui-même suit précisément les spécifications : les groupes d'agents utilisateurs sont mis en correspondance sans tenir compte de la casse, avec une correspondance exacte ou un préfixe sur le jeton de produit battant toujours le groupe de secours `*`, et plusieurs blocs déclarant le même jeton sont fusionnés comme le font les vrais robots d'exploration. Au sein du groupe gagnant, chaque règle d'autorisation et d'interdiction est vérifiée par rapport au chemin en utilisant la sémantique de caractère générique appropriée (`*` correspond à n'importe quelle séquence, un `$` final s'ancre à la fin du chemin), et le modèle correspondant le plus long gagne - avec une autorisation gagnant toute égalité contre une interdiction de longueur égale, exactement comme documenté par la propre implémentation robots.txt de Google.
Le panneau de résultats ne dit pas seulement AUTORISÉ ou BLOQUÉ - il nomme la ligne exacte et le texte de la règle responsable, afin que vous puissiez revenir directement à votre fichier et corriger (ou confirmer) la directive qui compte. C'est le détail que la plupart des vérificateurs de robots.txt ignorent, et c'est la différence entre deviner pourquoi une page n'est pas explorée et en être sûr.