0

Probador de robots.txt

Pegue un archivo robots.txt, elija un rastreador (incluidos GPTBot, ClaudeBot y Google-Extended) y vea instantáneamente si puede recuperar una ruta URL determinada, con la regla exacta y el número de línea que lo decidió.

Buy Me a Coffee at ko-fi.com
Procesando... 0%
Analizando robots.txt
Reglas coincidentes del rastreador
hecho

Resultado

Un archivo robots.txt es engañosamente simple de leer y sorprendentemente fácil de equivocarse: un `Disallow: /` perdido bajo el grupo de agente de usuario incorrecto puede desindexar silenciosamente un sitio completo, mientras que una regla que parece bloquear a un rastreador puede ser anulada por un patrón más largo y específico en otra parte del archivo. Esta herramienta vuelve a implementar el algoritmo de coincidencia real que utilizan los motores de búsqueda y los rastreadores de IA (el Protocolo de exclusión de robots de facto formalizado en RFC 9309 y documentado por Google) en lugar de aproximarlo con un simple escaneo línea por línea, por lo que el veredicto que ve aquí es el veredicto que calcularía un rastreador real.

Pegue el contenido de su robots.txt, escriba la ruta URL que desea verificar (como `/admin/` o `/blog/draft-post`) y elija un rastreador de una lista empaquetada de 20 tokens de agentes de usuario reales. Esa lista va intencionalmente más allá de los clásicos (Googlebot, Bingbot y el respaldo `*`) para incluir la generación actual de raspadores de IA: GPTBot y OAI-SearchBot (OpenAI), ClaudeBot y anthropic-ai (Anthropic), Google-Extended (la señal de exclusión voluntaria del entrenamiento de IA de Google, separada del rastreador de búsqueda de Googlebot), Applebot-Extended (la opción de exclusión voluntaria equivalente de Apple), PerplexityBot, CCBot (Common Crawl, cuyo archivo alimenta muchos otros modelos de IA), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot y más. Cada ficha se envía con una explicación breve y honesta de lo que realmente es.

El algoritmo en sí sigue la especificación con precisión: los grupos de agentes de usuario se comparan sin distinguir entre mayúsculas y minúsculas, con una coincidencia exacta o de prefijo en el token del producto siempre superando al grupo alternativo `*`, y múltiples bloques que declaran el mismo token se fusionan como lo hacen los rastreadores reales. Dentro del grupo ganador, cada regla de Permitir y No Permitir se compara con la ruta utilizando la semántica de comodines adecuada (`*` coincide con cualquier secuencia, un `$` al final se ancla al final de la ruta), y el patrón coincidente más largo gana; Permitir gana cualquier empate contra un Disallow de igual longitud, exactamente como lo documenta la propia implementación de robots.txt de Google.

El panel de resultados no solo dice PERMITIDO o BLOQUEADO: nombra la línea exacta y el texto de la regla responsable, para que pueda volver directamente a su archivo y corregir (o confirmar) la directiva que importa. Ese es el detalle que la mayoría de los verificadores de robots.txt omiten, y es la diferencia entre adivinar por qué no se rastrea una página y saberlo con certeza.