0

Robots.txt Tester

Prilepite datoteko robots.txt, izberite pajka – vključno z GPTBot, ClaudeBot in Google-Extended – in takoj preverite, ali lahko pridobi dano pot URL s točnim pravilom in številko vrstice, ki je odločila.

Buy Me a Coffee at ko-fi.com
Obdelava ... 0%
Razčlenjevanje robots.txt
Ujemanje pravil pajka
Končano

Rezultat

Datoteka robots.txt je varljivo enostavna za branje in presenetljivo enostavno se je zmotiti: potepuški `Disallow: /` pod napačno skupino User-agent lahko tiho odstrani indeksiranje celotnega spletnega mesta, medtem ko lahko pravilo, ki je videti, kot da blokira pajka, preglasi daljši, natančnejši vzorec drugje v datoteki. To orodje ponovno implementira dejanski algoritem ujemanja, ki ga uporabljajo iskalniki in pajki AI – de facto protokol za izključitev robotov, formaliziran v RFC 9309 in dokumentiran s strani Googla – namesto da bi ga približal s preprostim skeniranjem vrstice za vrstico, tako da je razsodba, ki jo vidite tukaj, sodba, ki bi jo izračunal pravi pajek.

Prilepite svojo vsebino robots.txt, vnesite URL pot, ki jo želite preveriti (na primer `/admin/` ali `/blog/draft-post`), in izberite pajka s seznama 20 dejanskih žetonov uporabniškega posrednika. Ta seznam namenoma presega klasične – Googlebot, Bingbot in nadomestni `*` — in vključuje trenutno generacijo strgal AI: GPTBot in OAI-SearchBot (OpenAI), ClaudeBot in anthropic-ai (Anthropic), Google-Extended (Googlov signal za zavrnitev usposabljanja AI, ločen od Googlebotovega iskalnega pajka), Applebot-Extended (Applov enakovreden opt-out), PerplexityBot, CCBot (Common Crawl, katerega arhiv napaja številne druge modele AI), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot in več. Vsak žeton je priložen kratki, iskreni razlagi, kaj dejansko je.

Sam algoritem natančno sledi specifikaciji: skupine uporabniških agentov se ujemajo brez upoštevanja velikih in malih črk, pri čemer natančno ujemanje ali ujemanje predpone na žetonu izdelka vedno premaga nadomestno skupino »*«, več blokov, ki deklarirajo isti žeton, pa se združi, kot to počnejo pravi pajki. Znotraj zmagovalne skupine se vsako pravilo Dovoli in Prepovedi preveri glede na pot z ustrezno semantiko nadomestnih znakov (`*` se ujema s katerim koli zaporedjem, končni `$` se zasidra na koncu poti) in zmaga najdaljši ujemajoči se vzorec – pri Dovoli zmaga vsako izenačenje proti Disallow enake dolžine, natančno kot je dokumentirano z Googlovo lastno izvedbo robots.txt.

Na plošči z rezultati ne piše samo DOVOLJENO ali BLOKIRano – poimenuje točno odgovorno vrstico in besedilo pravila, tako da se lahko takoj vrnete v svojo datoteko in popravite (ali potrdite) direktivo, ki je pomembna. To je podrobnost, ki jo večina preverjevalcev robots.txt preskoči, in to je razlika med ugibanjem, zakaj stran ni preiskana, in zanesljivim vedenjem.