Tester Robots.txt
Lipiți un fișier robots.txt, alegeți un crawler – inclusiv GPTBot, ClaudeBot și Google-Extended – și vedeți instantaneu dacă poate prelua o anumită cale URL, cu regula exactă și numărul de linie care a decis acest lucru.
Rezultat
Un fișier robots.txt este înșelător de simplu de citit și surprinzător de ușor de greșit: un `Disallow: /` rătăcit din grupul User-agent greșit poate de-indexa în tăcere un întreg site, în timp ce o regulă care pare că blochează un crawler poate fi înlocuită de un model mai lung și mai specific în altă parte a fișierului. Acest instrument reimplementează algoritmul de potrivire real pe care îl folosesc motoarele de căutare și crawlerele AI – protocolul de excludere a roboților de facto formalizat în RFC 9309 și documentat de Google – în loc să îl aproximeze cu o simplă scanare linie cu linie, astfel încât verdictul pe care îl vedeți aici este verdictul pe care l-ar calcula un crawler real.
Inserați conținutul robots.txt, introduceți calea URL pe care doriți să o verificați (cum ar fi `/admin/` sau `/blog/draft-post`) și alegeți un crawler dintr-o listă de 20 de jetoane user-agent reale. Această listă depășește în mod intenționat clasicele - Googlebot, Bingbot și `*` alternativă - pentru a include generația actuală de scrapers AI: GPTBot și OAI-SearchBot (OpenAI), ClaudeBot și anthropic-ai (Anthropic), Google-Extended (Google AI-training opt-out), semnalul Apple-Extended de renunțare la AI-training, Apple-Extended. (Renunțarea echivalentă a Apple), PerplexityBot, CCBot (Common Crawl, a cărui arhivă alimentează multe alte modele AI), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot și multe altele. Fiecare jeton este livrat cu o explicație scurtă și sinceră despre ceea ce este de fapt.
Algoritmul în sine respectă specificațiile cu precizie: grupurile user-agent sunt potrivite fără a ține seama de majuscule și minuscule, cu o potrivire exactă sau de prefix pe simbolul de produs învingând întotdeauna grupul de rezervă `*`, iar mai multe blocuri care declară același simbol sunt îmbinate așa cum fac crawlerele reale. În cadrul grupului câștigător, fiecare regulă Allow and Disallow este verificată în raport cu calea utilizând o semantică wildcard adecvată (`*` se potrivește cu orice secvență, un `$` în urmă se ancorează la sfârșitul căii) și cel mai lung model de potrivire câștigă - cu un Allow câștigând orice egalitate împotriva unui Disallow de lungime egală, exact așa cum este documentat de robotul Googletx.
Panoul de rezultate nu spune doar PERMIS sau BLOCAT, ci denumește linia exactă și textul regulii responsabil, astfel încât să puteți reveni direct la fișierul dvs. și să remediați (sau să confirmați) directiva care contează. Acesta este detaliul pe care majoritatea verificatoarelor robots.txt omit și este diferența dintre a ghici de ce o pagină nu este accesată cu crawlere și a ști cu siguranță.