Robots.txt-testaaja
Liitä robots.txt-tiedosto, valitse crawler – mukaan lukien GPTBot, ClaudeBot ja Google-Extended – ja näet heti, saako se noutaa annetun URL-polun, sekä tarkalleen sen säännön ja rivinumeron, joka ratkaisi asian.
🔒 Käsitelty kokonaan selaimessasi – mitään tähän kirjoittamaasi ei koskaan ladata.
Tulos
Robots.txt-tiedosto on petollisen helppolukuinen ja yllättävän helppo saada pieleen: harhaileva `Disallow: /` väärän User-agent-ryhmän alla voi hiljaisesti poistaa koko sivuston indeksistä, kun taas sääntö, joka näyttää estävän crawlerin, voi kumoutua pidemmällä, tarkemmalla mallilla jossain toisaalla tiedostossa. Tämä työkalu toteuttaa uudelleen sen varsinaisen täsmäytysalgoritmin, jota hakukoneet ja tekoälykeräimet käyttävät – RFC 9309:ssä muotoillun ja Googlen dokumentoiman de facto -standardin Robots Exclusion Protocolin – eikä arvioi sitä yksinkertaisella rivi riviltä -skannauksella, joten tässä näkyvä lopputulos on se, jonka oikea crawler laskisi.
Liitä robots.txt-sisältösi, kirjoita URL-polku, jonka haluat tarkistaa (kuten `/admin/` tai `/blog/draft-post`), ja valitse crawler 20 oikean user-agent-tunnisteen listalta. Lista ulottuu tarkoituksella klassikoiden – Googlebotin, Bingbotin ja `*`-yleismerkin – ohi nykyisen aallon tekoälykeräimiin: GPTBot ja OAI-SearchBot (OpenAI), ClaudeBot ja anthropic-ai (Anthropic), Google-Extended (Googlen tekoälyn koulutuksen opt-out-signaali, erillään Googlebot-hakukonecrawlerista), Applebot-Extended (Applen vastaava opt-out), PerplexityBot, CCBot (Common Crawl, jonka arkistoa hyödynnetään laajasti muissa tekoälymalleissa), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot ja muita. Jokaisen tunnisteen mukana tulee lyhyt, rehellinen selitys siitä, mikä se todellisuudessa on.
Itse algoritmi noudattaa speksiä tarkasti: user-agent-ryhmät täsmätään kirjainkoosta riippumatta, jolloin tarkka tai etuliiteosuma tuotetunnisteessa voittaa aina `*`-yleisryhmän, ja saman tunnisteen ilmoittavat useat lohkot yhdistetään kuten oikeat crawlerit tekevät. Voittaneen ryhmän sisällä jokainen Allow- ja Disallow-sääntö tarkistetaan polkua vasten käyttäen oikeita jokerimerkkisemantiikkoja (`*` vastaa mitä tahansa merkkijonoa, lopussa oleva `$` ankkuroi polun loppuun), ja pisin täsmäävä malli voittaa – tasatilanteessa Allow voittaa Disallowin, aivan kuten Googlen oma robots.txt-toteutus dokumentoi.
Tulospaneeli ei vain kerro SALLITTU tai ESTETTY – se nimeää tarkan rivin ja säännön tekstin, joka on vastuussa, joten voit siirtyä suoraan takaisin tiedostoosi ja korjata (tai vahvistaa) juuri sen direktiivin, jolla on merkitystä. Tämä on se yksityiskohta, jonka useimmat robots.txt-tarkistimet ohittavat, ja se on ero sen välillä, arvaatko, miksi sivua ei indeksoida, ja sen, tiedätkö sen varmasti.