Testeur de Robots.txt
Collez un fichier robots.txt, choisissez un robot d’exploration — y compris GPTBot, ClaudeBot et Google-Extended — et voyez instantanément s’il peut récupérer un chemin d’URL donné, avec la règle et le numéro de ligne exacts qui ont décidé.
🔒 Entièrement traité dans votre navigateur — rien de ce que vous saisissez ici n'est jamais téléchargé.
Résultat
Un fichier robots.txt est d’une simplicité trompeuse à lire et étonnamment facile à mal écrire : un `Disallow: /` égaré sous le mauvais groupe User-agent peut désindexer silencieusement un site entier, tandis qu’une règle qui semble bloquer un robot peut être annulée par un motif plus long et plus spécifique ailleurs dans le fichier. Cet outil réimplémente l’algorithme de correspondance réel utilisé par les moteurs de recherche et les robots d’exploration IA — le protocole d’exclusion des robots (REP) de facto formalisé dans la RFC 9309 et documenté par Google — plutôt que de l’approcher par un simple balayage ligne par ligne, de sorte que le verdict que vous voyez ici est le verdict qu’un vrai robot calculerait.
Collez le contenu de votre robots.txt, saisissez le chemin d’URL que vous souhaitez vérifier (comme `/admin/` ou `/blog/brouillon-article`), et choisissez un robot d’exploration dans une liste intégrée de 20 jetons d’agents utilisateurs réels. Cette liste va intentionnellement au-delà des classiques — Googlebot, Bingbot et le joker `*` — pour inclure la génération actuelle de scrapers IA : GPTBot et OAI-SearchBot (OpenAI), ClaudeBot et anthropic-ai (Anthropic), Google-Extended (le signal d’exclusion pour l’entraînement IA de Google, distinct du robot de recherche Googlebot), Applebot-Extended (l’exclusion équivalente d’Apple), PerplexityBot, CCBot (Common Crawl, dont l’archive alimente de nombreux autres modèles IA), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot et d’autres. Chaque jeton est accompagné d’une explication courte et honnête de ce qu’il est réellement.
L’algorithme lui-même suit la spécification à la lettre : les groupes d’agents utilisateurs sont mis en correspondance sans tenir compte de la casse, une correspondance exacte ou par préfixe sur le jeton de produit l’emportant toujours sur le groupe de repli `*`, et les blocs multiples déclarant le même jeton sont fusionnés comme le font les vrais robots. Au sein du groupe gagnant, chaque règle Allow et Disallow est vérifiée par rapport au chemin en utilisant la sémantique correcte des caractères génériques (`*` correspond à n’importe quelle séquence, un `$` final ancre à la fin du chemin), et le motif correspondant le plus long l’emporte — un Allow remportant toute égalité contre un Disallow de même longueur, exactement comme documenté par l’implémentation robots.txt de Google elle-même.
Le panneau de résultat n’affiche pas seulement ALLOWED ou BLOCKED — il nomme la ligne et le texte de la règle exacts qui en sont responsables, pour que vous puissiez retourner directement à votre fichier et corriger (ou confirmer) la directive qui compte. C’est le détail que la plupart des vérificateurs de robots.txt omettent, et c’est la différence entre deviner pourquoi une page n’est pas explorée et le savoir avec certitude.