Preizkuševalnik Robots.txt
Prilepite datoteko robots.txt, izberite pajka — vključno z GPTBot, ClaudeBot in Google-Extended — in takoj preverite, ali lahko pridobi dano pot URL, z natančnim pravilom in številko vrstice, ki je odločila.
🔒 V celoti obdelano v vašem brskalniku – nič, kar tukaj vnesete, ni nikoli naloženo.
Rezultat
Datoteka robots.txt je navidezno preprosta za branje in presenetljivo lahka za napačno razumevanje: ena sama zablodela vrstica `Disallow: /` pod napačno skupino User-agent lahko tiho odstrani celotno spletno mesto iz indeksa, medtem ko lahko pravilo, ki je videti, kot da blokira pajka, prepiše daljši, bolj specifičen vzorec drugje v datoteki. To orodje ponovno izvaja dejanski algoritem ujemanja, ki ga uporabljajo iskalniki in pajki UI — de facto Robots Exclusion Protocol, formaliziran v RFC 9309 in dokumentiran s strani Googla — namesto da bi ga približevalo s preprostim pregledovanjem vrstic, zato je razsodba, ki jo vidite tukaj, razsodba, ki bi jo izračunal pravi pajek.
Prilepite vsebino datoteke robots.txt, vnesite pot URL, ki jo želite preveriti (na primer `/admin/` ali `/blog/osnutek-clanka`), in izberite pajka s seznama 20 resničnih žetonov uporabniških agentov. Ta seznam namenoma presega klasike — Googlebot, Bingbot in nadomestni `*` — in vključuje trenutno generacijo strgalnikov UI: GPTBot in OAI-SearchBot (OpenAI), ClaudeBot in anthropic-ai (Anthropic), Google-Extended (Googlov signal za odjavo od učenja UI, ločen od Googlovega iskalnega pajka Googlebot), Applebot-Extended (Applov enakovreden odjavni signal), PerplexityBot, CCBot (Common Crawl, katerega arhiv napaja številne druge modele UI), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot in več. Vsak žeton vključuje kratko, pošteno razlago, kaj dejansko je.
Algoritem sam natančno sledi specifikaciji: skupine uporabniških agentov se ujemajo brez razlikovanja velikih in malih črk, pri čemer natančno ali predponsko ujemanje žetona izdelka vedno premaga nadomestno skupino `*`, več blokov, ki navajajo isti žeton, pa se združi tako, kot to počnejo pravi pajki. Znotraj zmagovalne skupine se vsako pravilo Allow in Disallow preveri glede na pot z uporabo pravilne semantike nadomestnih znakov (`*` se ujema s poljubnim zaporedjem, končni `$` zasidra na konec poti), najdaljši ujemajoči se vzorec pa zmaga — pri čemer pravilo Allow zmaga vsak izenačen izid proti pravilu Disallow enake dolžine, natanko tako, kot je dokumentirano v Googlovi lastni implementaciji robots.txt.
Prikaz rezultatov ne pove samo DOVOLJENO ali BLOKIRANO — navede natančno vrstico in besedilo pravila, ki je odgovorno, tako da se lahko takoj vrnete v svojo datoteko in popravite (ali potrdite) direktivo, ki je pomembna. To je podrobnost, ki jo večina preverjevalnikov robots.txt preskoči, in je razlika med ugibanjem, zakaj stran ni bila preiskana, in gotovostjo.