0

Tester robots.txt

Vložte soubor robots.txt, vyberte crawler — včetně GPTBot, ClaudeBot a Google-Extended — a okamžitě zjistěte, zda může načíst danou URL cestu, s přesným pravidlem a číslem řádku, které o tom rozhodlo.

🔒 Zpracováno výhradně ve vašem prohlížeči – nic, co zde zadáte, se nikdy nenahraje.

Zpracovává se... 0%
Parsování robots.txt
Porovnávání pravidel crawlerů
Hotovo

Výsledek

Soubor robots.txt je zdánlivě jednoduchý na čtení a překvapivě snadno se v něm udělá chyba: jeden nepatřičný `Disallow: /` pod špatnou skupinou User-agent může potichu deindexovat celý web, zatímco pravidlo, které vypadá, že crawler blokuje, může být přepsáno delším a konkrétnějším vzorem jinde v souboru. Tento nástroj implementuje skutečný porovnávací algoritmus, který používají vyhledávače a AI crawler y — de facto standard Robots Exclusion Protocol formalizovaný v RFC 9309 a zdokumentovaný Googlem — a ne pouze jeho přiblížení jednoduchým skenováním řádek po řádku, takže verdikt, který zde vidíte, je verdikt, který by spočítal skutečný crawler.

Vložte obsah svého robots.txt, zadejte URL cestu, kterou chcete zkontrolovat (např. `/admin/` nebo `/blog/draft-post`), a vyberte crawler z připraveného seznamu 20 reálných tokenů user-agentů. Tento seznam záměrně přesahuje klasiku — Googlebot, Bingbot a záložní `*` — a zahrnuje současnou generaci AI scraperů: GPTBot a OAI-SearchBot (OpenAI), ClaudeBot a anthropic-ai (Anthropic), Google-Extended (signál Googlu pro opt-out z trénování AI, oddělený od vyhledávacího crawleru Googlebot), Applebot-Extended (ekvivalentní opt-out od Applu), PerplexityBot, CCBot (Common Crawl, jehož archiv slouží jako zdroj pro mnoho dalších AI modelů), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot a další. Ke každému tokenu je přiloženo krátké, věcné vysvětlení, co ve skutečnosti je.

Samotný algoritmus přesně dodržuje specifikaci: skupiny user-agentů se porovnávají bez ohledu na velikost písmen, přičemž přesná nebo prefixová shoda s tokenem produktu vždy porazí záložní skupinu `*`, a více bloků deklarujících stejný token se slučuje tak, jak to dělají skutečné crawlery. V rámci vítězné skupiny se každé pravidlo Allow a Disallow porovnává s cestou za použití správné sémantiky zástupných znaků (`*` odpovídá libovolné sekvenci, koncový `$` ukotvuje na konec cesty) a vítězí nejdelší vyhovující vzor — přičemž Allow vyhrává jakoukoli remízu proti Disallow stejné délky, přesně jak to dokumentuje vlastní implementace robots.txt od Googlu.

Panel s výsledkem neřekne jen POVOLENO nebo ZABLOKOVÁNO — uvede přesný řádek a text pravidla, který za to může, takže se můžete rovnou vrátit do souboru a opravit (nebo potvrdit) direktivu, na které záleží. To je detail, který většina kontrolérů robots.txt přeskakuje, a je to rozdíl mezi dohadováním, proč stránka není craw lována, a jistotou.