0

Robots.txt Tesztelő

Illessz be egy robots.txt fájlt, válassz ki egy böngészőrobotot – beleértve a GPTBot, ClaudeBot és Google-Extended azonosítókat –, és azonnal lásd, hogy egy adott URL elérési útjáról letölthet-e tartalmat, a döntő szabály pontos sorával és sorszámával együtt.

🔒 Teljesen a böngészőjében dolgozzák fel – soha semmi, amit itt beírt, nem kerül feltöltésre.

Feldolgozás... 0%
robots.txt feldolgozása
Böngészőrobot-szabályok illesztése
Kész

Eredmény

Egy robots.txt fájl meglepően egyszerűnek tűnik, de könnyű hibázni: egy téves `Disallow: /` sor egy rossz User-agent csoport alatt észrevétlenül kitilthat egy egész webhelyet a keresőkből, miközben egy blokkolásnak látszó szabályt felülírhat egy hosszabb, specifikusabb minta a fájl másik részében. Ez az eszköz a keresőmotorok és AI böngészőrobotok által ténylegesen használt illesztési algoritmust valósítja meg – a gyakorlatban elterjedt Robots Exclusion Protocolt, melyet az RFC 9309 formalizál és a Google dokumentált –, ahelyett hogy egy egyszerű soronkénti vizsgálattal közelítené azt, így az itt kapott eredmény az, amit egy valódi böngészőrobot is kiszámítana.

Illeszd be a robots.txt tartalmát, írd be az ellenőrizni kívánt URL elérési utat (pl. `/admin/` vagy `/blog/draft-post`), és válassz egy böngészőrobotot a 20 valós user-agent azonosítót tartalmazó beépített listából. Ez a lista szándékosan túlmutat a klasszikusokon – Googlebot, Bingbot és a `*` alapértelmezés –, és tartalmazza az AI adatgyűjtők jelenlegi hullámát: GPTBot és OAI-SearchBot (OpenAI), ClaudeBot és anthropic-ai (Anthropic), Google-Extended (a Google AI-tréningezéséből való kimaradás jelzése, elkülönítve a Googlebot keresőrobottól), Applebot-Extended (az Apple hasonló kimaradási jelzése), PerplexityBot, CCBot (Common Crawl, melynek archívumát számos más AI-modell is használja), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot és mások. Minden azonosítóhoz rövid, korrekt leírás tartozik arról, hogy pontosan mire való.

Az algoritmus pontosan követi a specifikációt: a user-agent csoportok illesztése kis- és nagybetűk megkülönböztetése nélkül történik, ahol a pontos vagy előtag-illesztésű termék-azonosító mindig megelőzi a `*` alapértelmezett csoportot, és az azonos azonosítót deklaráló többszörös blokkokat a valódi böngészőrobotokhoz hasonlóan vonja össze. A nyertes csoporton belül minden Allow és Disallow szabály ellenőrzésre kerül az elérési úttal szemben, megfelelő helyettesítő karakteres szemantikával (`*` bármilyen karaktersorozatra illeszkedik, a `$` a végén az elérési út végéhez horgonyoz), és a leghosszabb egyező minta nyer – egyenlő hosszúság esetén az Allow elsőbbséget élvez a Disallow-val szemben, pontosan a Google robots.txt implementációjának dokumentációja szerint.

Az eredménypanel nem csupán annyit mond, hogy ENGEDÉLYEZVE vagy BLOKKOLVA – megnevezi a döntést hozó pontos sort és szabályt, így azonnal visszakeresheted a fájlodban, és kijavíthatod (vagy megerősítheted) a lényeges direktívát. Ez az a részlet, amit a legtöbb robots.txt ellenőrző kihagy, és ez a különbség aközött, hogy csak találgatod, miért nem töltik le az oldaladat, vagy pontosan tudod.