0

Probador de Robots.txt

Pega un archivo robots.txt, elige un rastreador —incluidos GPTBot, ClaudeBot y Google‑Extended— y ve al instante si puede acceder a una ruta URL determinada, con la regla exacta y el número de línea que lo decidió.

🔒 Procesado íntegramente en su navegador: nada de lo que ingresa aquí se carga nunca.

Procesando... 0%
Analizando robots.txt
Cotejando reglas del rastreador
Listo

Resultado

Un archivo robots.txt es engañosamente sencillo de leer y sorprendentemente fácil de estropear: un `Disallow: /` extraviado bajo el grupo de User‑agent equivocado puede desindexar silenciosamente un sitio entero, mientras que una regla que parece bloquear a un rastreador puede ser anulada por un patrón más largo y específico en otra parte del archivo. Esta herramienta reimplementa el algoritmo de coincidencia real que utilizan los motores de búsqueda y los rastreadores de IA —el protocolo de exclusión de robots (REP) de facto, formalizado en la RFC 9309 y documentado por Google— en lugar de aproximarlo con un simple barrido línea por línea, de modo que el veredicto que ves aquí es el que calcularía un rastreador real.

Pega el contenido de tu robots.txt, escribe la ruta URL que quieres comprobar (como `/admin/` o `/blog/borrador-entrada`) y elige un rastreador de una lista incluida de 20 tokens de user‑agent reales. Esa lista va más allá de los clásicos —Googlebot, Bingbot y el comodín `*`— para incluir la generación actual de scrapers de IA: GPTBot y OAI‑SearchBot (OpenAI), ClaudeBot y anthropic‑ai (Anthropic), Google‑Extended (la señal de exclusión para el entrenamiento de IA de Google, independiente del rastreador de búsqueda Googlebot), Applebot‑Extended (la exclusión equivalente de Apple), PerplexityBot, CCBot (Common Crawl, cuyo archivo alimenta muchos otros modelos de IA), Bytespider (ByteDance), Meta‑ExternalAgent, Amazonbot y más. Cada token se acompaña de una breve explicación honesta de lo que realmente es.

El algoritmo en sí sigue la especificación al pie de la letra: los grupos de user‑agent se comparan sin distinción de mayúsculas, donde una coincidencia exacta o por prefijo del token de producto siempre prevalece sobre el grupo comodín `*`, y los bloques múltiples que declaran el mismo token se fusionan como hacen los rastreadores reales. Dentro del grupo ganador, cada regla Allow y Disallow se compara con la ruta usando la semántica adecuada de comodines (`*` coincide con cualquier secuencia, un `$` al final ancla al final de la ruta), y gana el patrón coincidente más largo; en caso de empate de longitud entre Allow y Disallow, gana Allow, exactamente como documenta la implementación de robots.txt del propio Google.

El panel de resultados no se limita a decir PERMITIDO o BLOQUEADO: indica la línea exacta y el texto de la regla responsable, para que puedas ir directamente a tu archivo y corregir (o confirmar) la directiva que importa. Ese es el detalle que la mayoría de los comprobadores de robots.txt omiten, y es la diferencia entre suponer por qué una página no se rastrea y saberlo con certeza.