Robots.txt testija
Kleepige fail robots.txt, valige roomaja – sealhulgas GPTBot, ClaudeBot ja Google-Extended – ning vaadake kohe, kas see saab tuua antud URL-i tee koos täpse reegli ja reanumbriga, mis selle otsustasid.
Tulemus
Faili robots.txt on petlikult lihtne lugeda ja üllatavalt lihtne eksida: vale kasutajaagendi rühma all olev eksitav käsk "Disallow: /" võib vaikselt kogu saidi indeksist eemaldada, samas kui reegli, mis näeb välja nagu roomaja blokeerimine, saab alistada pikema ja täpsema mustri mujal failis. See tööriist rakendab uuesti otsingumootorite ja AI indeksoijate kasutatavat tegelikku sobitusalgoritmi – de-facto Robots Exclusion Protocol, mis on vormistatud RFC 9309-ga ja mille on dokumenteerinud Google – selle asemel, et seda lihtsa reahaaval skaneerimisega ligilähendada, nii et siin näete otsus, mille arvutaks välja tõeline roomaja.
Kleepige faili robots.txt sisu, tippige URL-i tee, mida soovite kontrollida (nt `/admin/` või `/blog/draft-post`) ja valige 20 päris kasutajaagendi märgist koosnevast komplekteeritud loendist roomaja. See nimekiri läheb tahtlikult klassikalistest – Googlebot, Bingbot ja „*” tagavarast – kaugemale, hõlmates praeguse põlvkonna tehisintellekti kaabitsaid: GPTBot ja OAI-SearchBot (OpenAI), ClaudeBot ja anthropic-ai (Anthropic), Google-Extended (Google'i tehisintellekti koolituse samaväärne loobumissignaal), robotite loobumise signaal, eraldi Crawtened Apple'i robotidest (Apple'i robotid). PerplexityBot, CCBot (Common Crawl, mille arhiiv toidab paljusid teisi tehisintellekti mudeleid), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot ja palju muud. Iga märgiga on kaasas lühike ja aus selgitus selle kohta, mis see tegelikult on.
Algoritm ise järgib täpselt spetsifikatsiooni: kasutaja-agendi rühmad sobitatakse tõstutundlikult, tootemärgi täpne või prefiksi vaste ületab alati tagavararühma * ja mitu sama luba deklareerivat plokki liidetakse nagu tõelised roomajad. Võitnud grupis kontrollitakse iga lubamise ja keelamise reeglit tee suhtes, kasutades õiget metamärgisemantikat (“*” vastab mis tahes järjestusele, lõpus olev $$ ankurdub tee lõppu) ja võidab pikim sobiv muster – Luba võita võrdse pikkusega keelamise vastu täpselt nii, nagu Google'i enda robotid on dokumenteerinud.
Tulemuste paneel ei ütle ainult LUBATUD või BLOCKED – see nimetab täpselt vastutava rea ja reegliteksti, nii et saate otse oma faili juurde tagasi minna ja olulist käskkirja parandada (või kinnitada). See on detail, mille enamik robots.txt kontrollijaid vahele jätab. See on erinevus selle vahel, kas arvatakse, miks lehte ei roomata, ja selle kindla teadmise vahel.