Robots.txt testimise tööriist
Kleebi robots.txt fail, vali roomik – sealhulgas GPTBot, ClaudeBot ja Google-Extended – ning näe hetkega, kas see pääseb antud URL-i teele ligi, koos täpse reegli ja rea numbriga, mis selle otsustas.
🔒 Töödeldud täielikult teie brauseris – midagi, mida siia sisestate, ei laadita kunagi üles.
Tulemus
Robots.txt faili on petlikult lihtne lugeda ja üllatavalt kerge valesti teha: valesse User-agent gruppi sattunud `Disallow: /` võib vaikimisi terve saidi indeksist eemaldada, samas kui reegel, mis näib roomiku blokeerivat, võib failis mujal oleva pikema, spetsiifilisema mustriga tühistatud saada. See tööriist realiseerib päris sobitusalgoritmi, mida otsingumootorid ja tehisintellekti kogujad kasutavad – Robots Exclusion Protocoli de-facto standardi, mis on formaliseeritud RFC 9309-s ja mida Google dokumenteerib – mitte ei ligikaudselda seda lihtsa reahaaval skaneerimisega, nii et otsus, mida siin näed, on otsus, mille päris roomik arvutaks.
Kleebi oma robots.txt sisu, trüki kontrollitav URL-i tee (näiteks `/admin/` või `/blog/mustand-postitus`), ning vali roomik kaasatud 20 päris kasutaja-agendi tunnuse hulgast. See nimekiri läheb sihilikult klassikutest kaugemale – Googlebot, Bingbot ja `*` varuvariant –, hõlmates praegust tehisintellekti kogujate põlvkonda: GPTBot ja OAI-SearchBot (OpenAI), ClaudeBot ja anthropic-ai (Anthropic), Google-Extended (Google'i tehisintellekti treeningu keelamise signaal, eraldi Googleboti otsinguroomikust), Applebot-Extended (Apple'i samaväärne keelamissignaal), PerplexityBot, CCBot (Common Crawl, mille arhiivi kasutavad laialdaselt teised tehisintellekti mudelid), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot ja paljud teised. Iga tunnus on varustatud lühikese, ausa selgitusega, mis too tegelikult on.
Algoritm ise järgib täpselt spetsifikatsiooni: kasutaja-agendi grupid sobitatakse tõstutundlikult, kus täpne või prefiksiga vaste tootetunnusel edestab alati `*` varugruppi ja sama tunnust deklareerivad mitu plokki ühendatakse, nii nagu päris roomikud teevad. Võitvas grupis kontrollitakse iga Allow ja Disallow reeglit tee suhtes, kasutades korrektseid metamärgi semantikaid (`*` sobib suvalise jadaga, lõpus olev `$` ankurdab tee lõppu) ning pikim sobiv muster võidab – kusjuures Allow võidab võrdse pikkusega Disallow vastu, täpselt nagu Google'i enda robots.txt realisatsioon dokumenteerib.
Tulemuste paneel ei ütle lihtsalt LUBATUD või KEELATUD – see nimetab täpse rea ja reegli teksti, mis selle eest vastutab, et saaksid oma faili juurde tagasi minna ja asjakohase direktiivi parandada (või kinnitada). Just see detail jääb enamikul robots.txt kontrollijatel märkamata ja see on erinevus aina arvamise, miks lehte ei roomata, ja kindlalt teadmise vahel.