0

Robots.txt Tester

Vložte soubor robots.txt, vyberte prohledávač – včetně GPTBot, ClaudeBot a Google-Extended – a okamžitě zjistěte, zda dokáže načíst danou cestu URL s přesným pravidlem a číslem řádku, které to rozhodly.

Buy Me a Coffee at ko-fi.com
Zpracování... 0%
Analýza souboru robots.txt
Shoda pravidel prohledávače
Hotovo

Výsledek

Soubor robots.txt je zdánlivě jednoduchý na čtení a překvapivě snadno se splete: zbloudilý `Disallow: /` pod nesprávnou skupinou User-agent může tiše deindexovat celý web, zatímco pravidlo, které vypadá, že blokuje prohledávač, může být jinde v souboru přepsáno delším, konkrétnějším vzorem. Tento nástroj reimplementuje skutečný algoritmus shody, který používají vyhledávače a prohledávače AI – de facto Robots Exclusion Protocol formalizovaný v RFC 9309 a zdokumentovaný Googlem – namísto toho, aby jej aproximoval jednoduchým skenováním řádek po řádku, takže verdikt, který zde vidíte, je verdikt, který by vypočítal skutečný prohledávač.

Vložte obsah souboru robots.txt, zadejte cestu URL, kterou chcete zkontrolovat (například `/admin/` nebo `/blog/draft-post`), a vyberte prohledávač ze seznamu 20 skutečných tokenů user-agent. Tento seznam záměrně přesahuje klasiku – Googlebot, Bingbot a `*` záložní řešení – a zahrnuje současnou generaci AI scraperů: GPTBot a OAI-SearchBot (OpenAI), ClaudeBot a antropický-ai (Anthropic), Google-Extended (signál pro odhlášení od Googlu pro AI-trénink, oddělený od Googlebot-Apple prohledávaný ekvivalentní robot Apple opt-out), PerplexityBot, CCBot (Common Crawl, jehož archiv živí mnoho dalších modelů AI), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot a další. Každý žeton je dodáván s krátkým, upřímným vysvětlením, co to vlastně je.

Samotný algoritmus přesně dodržuje specifikaci: skupiny user-agent jsou porovnávány bez ohledu na velikost písmen, přičemž přesná shoda nebo shoda předpony na tokenu produktu vždy překonává záložní skupinu „*“ a více bloků deklarujících stejný token je sloučeno jako skutečné prohledávače. Ve vítězné skupině je každé pravidlo Allow a Disallow zkontrolováno vůči cestě pomocí správné sémantiky zástupných znaků (`*` odpovídá jakékoli sekvenci, koncový znak `$` se ukotví na konec cesty) a vyhrává nejdelší odpovídající vzor – s Povolit vyhrát jakoukoli remízu proti Disallow stejné délky, přesně jak to dokumentuje vlastní implementace robots.txt společnosti Google.

Panel výsledků neříká pouze POVOLENO nebo BLOKováno – pojmenovává přesný řádek a příslušný text pravidla, takže se můžete rovnou vrátit ke svému souboru a opravit (nebo potvrdit) direktivu, na které záleží. To je detail, který většina kontrolorů robots.txt přeskakuje, a je to rozdíl mezi hádaním, proč se stránka neprochází, a tím, že to vědí s jistotou.