Robots.txt testētājs
Ielīmējiet robots.txt failu, izvēlieties pārlūku — tostarp GPTBot, ClaudeBot un Google-Extended — un acumirklī redziet, vai tas var ielādēt norādīto URL ceļu, ar precīzu noteikumu un rindiņas numuru, kas to noteica.
🔒 Pilnībā apstrādāts jūsu pārlūkprogrammā — nekas, ko jūs šeit ievadāt, nekad netiek augšupielādēts.
Rezultāts
Robots.txt fails ir maldinoši vienkārši lasāms un pārsteidzoši viegli kļūdains: nejaušs `Disallow: /` zem nepareizas User-agent grupas var klusām deindeksēt visu vietni, savukārt noteikums, kas izskatās kā bloķējošs pārlūku, var tikt atcelts ar garāku, specifiskāku šablonu citur failā. Šis rīks atjauno īsto saskaņošanas algoritmu, ko izmanto meklētājprogrammas un AI pārlūki — de facto Robots Exclusion Protocol, kas formalizēts RFC 9309 un dokumentēts no Google puses —, nevis to tuvina ar vienkāršu rindiņu-pa-rindiņai skenēšanu, tāpēc šeit redzamais lēmums ir tāds, kādu aprēķinātu reāls pārlūks.
Ielīmējiet savu robots.txt saturu, ievadiet URL ceļu, ko vēlaties pārbaudīt (piemēram, `/admin/` vai `/blog/draft-post`), un izvēlieties pārlūku no iekļautā 20 reālu lietotāja-aģenta marķieru saraksta. Šis saraksts apzināti pārsniedz klasiskos — Googlebot, Bingbot un `*` vispārīgo grupu —, iekļaujot pašreizējo AI skrāpju paaudzi: GPTBot un OAI-SearchBot (OpenAI), ClaudeBot un anthropic-ai (Anthropic), Google-Extended (Google AI apmācības atteikšanās signāls, atdalīts no Googlebot meklēšanas pārlūka), Applebot-Extended (Apple līdzvērtīgais atteikšanās signāls), PerplexityBot, CCBot (Common Crawl, kura arhīvs baro daudzus citus AI modeļus), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot un citus. Katram marķierim ir pievienots īss, godīgs skaidrojums par to, kas tas īsti ir.
Pats algoritms precīzi seko specifikācijai: lietotāja-aģenta grupas tiek saskaņotas reģistrjutīgi, ar precīzu vai prefiksa atbilstību produkta marķierim vienmēr pārspējot `*` vispārīgo grupu, un vairāki bloki, kas deklarē to pašu marķieri, tiek apvienoti, kā to dara reāli pārlūki. Uzvarētāja grupā katrs Allow un Disallow noteikums tiek pārbaudīts pret ceļu, izmantojot pareizu aizstājējzīmju semantiku (`*` atbilst jebkurai secībai, beigu `$` noenkuro ceļa beigās), un uzvar garākais atbilstošais šablons — ar Allow uzvarot jebkurā neizšķirtā pret vienāda garuma Disallow, tieši tā, kā dokumentēts Google pašu robots.txt implementācijā.
Rezultātu panelis ne tikai saka ATĻAUTS vai BLOĶĒTS — tas norāda precīzu atbildīgo rindiņu un noteikuma tekstu, lai jūs varētu tūlīt pat doties atpakaļ uz savu failu un labot (vai apstiprināt) direktīvu, kas ir svarīga. Tā ir detaļa, ko lielākā daļa robots.txt pārbaužu izlaiž, un tā ir atšķirība starp minēšanu, kāpēc lapa netiek pārmeklēta, un drošu zināšanu.