0

Robots.txt tester

Zalijepite datoteku robots.txt, odaberite alat za indeksiranje — uključujući GPTBot, ClaudeBot i Google-Extended — i odmah pogledajte može li dohvatiti zadanu putanju URL-a, s točnim pravilom i brojem retka koji su to odredili.

Buy Me a Coffee at ko-fi.com
Obrada... 0%
Raščlanjivanje robots.txt
Odgovarajuća pravila indeksiranja
Gotovo

Rezultat

Datoteka robots.txt varljivo je jednostavna za čitanje i iznenađujuće je lako pogriješiti: zalutali `Disallow: /` pod pogrešnom grupom korisničkog agenta može tiho deindeksirati cijelu web-lokaciju, dok pravilo koje izgleda kao da blokira alat za indeksiranje može biti nadjačano dužim, specifičnijim uzorkom negdje drugdje u datoteci. Ovaj alat ponovno implementira stvarni algoritam podudaranja koji koriste tražilice i alati za indeksiranje umjetne inteligencije — de facto Protokol za isključivanje robota formaliziran u RFC 9309 i dokumentiran od strane Googlea — umjesto da ga aproksimira jednostavnim skeniranjem redak po redak, tako da je presuda koju vidite ovdje presuda koju bi izračunao pravi alat za indeksiranje.

Zalijepite svoj sadržaj robots.txt, upišite URL stazu koju želite provjeriti (poput `/admin/` ili `/blog/draft-post`) i odaberite alat za indeksiranje s popisa od 20 pravih tokena korisničkog agenta. Taj popis namjerno nadilazi klasike — Googlebot, Bingbot i rezervni `*` — kako bi uključio trenutnu generaciju AI strugača: GPTBot i OAI-SearchBot (OpenAI), ClaudeBot i anthropic-ai (Anthropic), Google-Extended (Googleov signal za isključivanje AI-obuke, odvojen od Googlebotovog alata za pretraživanje), Applebot-Extended (Appleov ekvivalent isključivanja), PerplexityBot, CCBot (Common Crawl, čija arhiva hrani mnoge druge AI modele), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot i više. Svaki token se isporučuje s kratkim, iskrenim objašnjenjem što on zapravo jest.

Sam algoritam precizno slijedi specifikaciju: grupe korisničkih agenata uparuju se bez obzira na velika i mala slova, s točnim podudaranjem ili podudaranjem prefiksa na tokenu proizvoda koji uvijek pobjeđuje zamjensku grupu `*`, a višestruki blokovi koji deklariraju isti token spajaju se kao što to rade pravi alati za indeksiranje. Unutar pobjedničke grupe, svako pravilo Dopusti i Zabrani provjerava se u odnosu na putanju pomoću odgovarajuće semantike zamjenskih znakova (`*` odgovara bilo kojem nizu, `$` na kraju se sidri na kraju putanje), a najduži odgovarajući uzorak pobjeđuje — s Dopuštanjem pobjeđuje bilo koji izjednačeni rezultat protiv Zabranjivanja jednake duljine, točno onako kako je dokumentirano Googleovom vlastitom implementacijom robots.txt.

Ploča s rezultatima ne kaže samo DOZVOLJENO ili BLOKIRano — ona imenuje točan redak i odgovorni tekst pravila, tako da se možete ravno vratiti na svoju datoteku i popraviti (ili potvrditi) direktivu koja je važna. To je detalj koji većina alata za provjeru robots.txt preskače, a to je razlika između nagađanja zašto se stranica ne indeksira i sigurnog saznanja.