0

Robots.txt tikrintuvas

Įklijuokite robots.txt failą, pasirinkite robotą – įskaitant GPTBot, ClaudeBot ir Google-Extended – ir akimirksniu pamatysite, ar jis gali pasiekti nurodytą URL kelią, su tikslia taisykle ir eilutės numeriu, lėmusiu sprendimą.

🔒 Visiškai apdorojama jūsų naršyklėje – niekas, kurį čia įvedėte, niekada neįkeliama.

Apdorojama... 0%
Analizuojamas robots.txt
Ieškomos robotų taisyklės
Baigta

Rezultatas

Robots.txt failas atrodo apgaulingai paprastai skaitomas, tačiau stebėtinai lengva suklysti: atsitiktinis `Disallow: /` po netinkama User-agent grupe gali tyliai pašalinti visą svetainę iš indekso, o taisyklė, kuri atrodo blokuojanti robotą, gali būti perrašyta ilgesnio, tikslesnio šablono kitoje failo vietoje. Šis įrankis iš naujo įgyvendina realų atitikimo algoritmą, kurį naudoja paieškos sistemos ir DI robotai – de facto Robots Exclusion Protocol, formalizuotą RFC 9309 ir dokumentuotą Google – o ne imituoja jį paprastu eilučių skenavimu, todėl čia matomas verdiktas yra toks, kokį paskaičiuotų tikras robotas.

Įklijuokite robots.txt turinį, įveskite tikrinamą URL kelią (pvz., `/admin/` ar `/blog/draft-post`) ir pasirinkite robotą iš integruoto 20 realių vartotojo agentų žetonų sąrašo. Šis sąrašas sąmoningai peržengia klasiką – Googlebot, Bingbot ir `*` numatytąją grupę – įtraukdamas dabartinės kartos DI rinkėjus: GPTBot ir OAI-SearchBot (OpenAI), ClaudeBot ir anthropic-ai (Anthropic), Google-Extended (Google DI mokymo atsisakymo signalas, atskirtas nuo Googlebot paieškos roboto), Applebot-Extended (Apple atitikmuo), PerplexityBot, CCBot (Common Crawl, kurio archyvą plačiai naudoja kiti DI modeliai), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot ir daugiau. Kiekvienas žetonas pateikiamas su trumpu, sąžiningu paaiškinimu, kas tai iš tikrųjų yra.

Pats algoritmas tiksliai seka specifikaciją: vartotojo agentų grupės lyginamos neskiriant didžiųjų ir mažųjų raidžių, tikslus arba priešdėlinis produkto žetono atitikimas visada laimi prieš `*` numatytąją grupę, o keli blokai, deklaruojantys tą patį žetoną, suliejami taip, kaip tai daro tikri robotai. Laimėjusioje grupėje kiekviena Allow ir Disallow taisyklė tikrinama pagal kelią naudojant tinkamą pakaitos simbolių semantiką (`*` atitinka bet kokią seką, galinis `$` inkaruoja kelio pabaigą), o ilgiausiai atitinkantis šablonas laimi – Allow laimi bet kokias lygiąsias prieš Disallow lygaus ilgio, tiksliai kaip dokumentuota Google pačios robots.txt įgyvendinime.

Rezultatų skydelyje ne tik sakoma LEIDŽIAMA ar UŽBLOKUOTA – jame įvardijama tiksli eilutė ir taisyklės tekstas, kurie už tai atsakingi, todėl galite iš karto grįžti prie failo ir pataisyti (arba patvirtinti) tą direktyvą, kuri svarbi. Tai detalė, kurią praleidžia dauguma robots.txt tikrintuvų, ir būtent ji skiria spėliojimą, kodėl puslapis nėra naršomas, nuo tikro žinojimo.