0

Testador Robots.txt

Cole um arquivo robots.txt, escolha um rastreador – incluindo GPTBot, ClaudeBot e Google-Extended – e veja instantaneamente se ele pode buscar um determinado caminho de URL, com a regra exata e o número da linha que o decidiu.

Buy Me a Coffee at ko-fi.com
Processando... 0%
Analisando robots.txt
Regras do rastreador correspondentes
Concluído

Resultado

Um arquivo robots.txt é aparentemente simples de ler e surpreendentemente fácil de errar: um `Disallow: /` perdido no grupo User-agent errado pode desindexar silenciosamente um site inteiro, enquanto uma regra que parece bloquear um rastreador pode ser substituída por um padrão mais longo e específico em outra parte do arquivo. Esta ferramenta reimplementa o algoritmo de correspondência real que os motores de busca e os rastreadores de IA usam - o protocolo de exclusão de robôs de fato formalizado na RFC 9309 e documentado pelo Google - em vez de aproximá-lo com uma simples varredura linha por linha, então o veredicto que você vê aqui é o veredicto que um rastreador real calcularia.

Cole o conteúdo do robots.txt, digite o caminho da URL que deseja verificar (como `/admin/` ou `/blog/draft-post`) e escolha um rastreador em uma lista agrupada de 20 tokens de agente de usuário reais. Essa lista vai intencionalmente além dos clássicos - Googlebot, Bingbot e o substituto `*` - para incluir a geração atual de scrapers de IA: GPTBot e OAI-SearchBot (OpenAI), ClaudeBot e anthropic-ai (Anthropic), Google-Extended (sinal de desativação do treinamento de IA do Google, separado do rastreador de pesquisa do Googlebot), Applebot-Extended (opt-out equivalente da Apple), PerplexityBot, CCBot (Common Crawl, cujo arquivo alimenta muitos outros modelos de IA), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot e muito mais. Cada token vem com uma explicação curta e honesta do que realmente é.

O algoritmo em si segue a especificação com precisão: grupos de agentes de usuário são combinados sem distinção entre maiúsculas e minúsculas, com uma correspondência exata ou de prefixo no token do produto sempre superando o grupo substituto `*`, e vários blocos que declaram o mesmo token são mesclados como os rastreadores reais fazem. Dentro do grupo vencedor, cada regra Permitir e Proibir é verificada em relação ao caminho usando a semântica curinga adequada (`*` corresponde a qualquer sequência, um `$` à direita ancora no final do caminho) e o padrão de correspondência mais longo vence - com um Permitir vencendo qualquer empate contra um Disallow de igual comprimento, exatamente como documentado pela implementação do robots.txt do próprio Google.

O painel de resultados não diz apenas PERMITIDO ou BLOQUEADO — ele nomeia a linha exata e o texto da regra responsáveis, para que você possa voltar diretamente ao seu arquivo e corrigir (ou confirmar) a diretiva que importa. Esse é o detalhe que a maioria dos verificadores de robots.txt ignora e é a diferença entre adivinhar por que uma página não está sendo rastreada e saber com certeza.