0

Тестер на Robots.txt

Поставете файл robots.txt, изберете робот — включително GPTBot, ClaudeBot и Google-Extended — и незабавно вижте дали може да извлече даден URL път с точното правило и номер на ред, който го е определил.

Buy Me a Coffee at ko-fi.com
Обработка... 0%
Анализ на robots.txt
Съответстващи правила за обхождане
Готово

Резултат

Файлът robots.txt е измамно лесен за четене и изненадващо лесен за грешка: заблуден `Disallow: /` под грешна група User-agent може тихо да деиндексира цял сайт, докато правило, което изглежда така, сякаш блокира робот, може да бъде заменено от по-дълъг, по-специфичен модел на друго място във файла. Този инструмент прилага отново действителния алгоритъм за съвпадение, използван от търсачките и AI роботите – де факто протоколът за изключване на роботи, формализиран в RFC 9309 и документиран от Google – вместо да го приближава с просто сканиране ред по ред, така че присъдата, която виждате тук, е присъдата, която истински робот би изчислил.

Поставете съдържанието на robots.txt, въведете URL пътя, който искате да проверите (като `/admin/` или `/blog/draft-post`), и изберете робот от пакетен списък с 20 реални токена на потребителски агент. Този списък умишлено надхвърля класическите — Googlebot, Bingbot и резервния `*` — за да включи текущото поколение AI скрепери: GPTBot и OAI-SearchBot (OpenAI), ClaudeBot и anthropic-ai (Anthropic), Google-Extended (сигнал за отказ от обучение на AI на Google, отделен от робота за търсене на Googlebot), Applebot-Extended (Еквивалентно отказване на Apple), PerplexityBot, CCBot (Common Crawl, чийто архив захранва много други AI модели), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot и др. Всеки жетон се доставя с кратко, честно обяснение какво всъщност представлява.

Самият алгоритъм следва прецизно спецификацията: групите потребителски агенти се съпоставят без значение за малки и големи букви, като точно или префиксно съвпадение на токена на продукта винаги изпреварва резервната група „*“, а множество блокове, деклариращи един и същ токен, се обединяват, както правят истинските роботи. В рамките на печелившата група всяко правило за разрешаване и забрана се проверява спрямо пътя, като се използва подходяща семантика на заместващия знак (`*` съвпада с всяка последователност, завършващ `$` се закотвя към края на пътя) и най-дългият съвпадащ модел печели — като Allow печели всяко равенство срещу Disallow с еднаква дължина, точно както е документирано от собствената реализация на robots.txt на Google.

Панелът с резултати не казва просто РАЗРЕШЕНО или БЛОКИРАНО — той назовава точния отговорен ред и текст на правилото, така че можете да се върнете направо към вашия файл и да коригирате (или потвърдите) директивата, която има значение. Това е детайлът, който повечето програми за проверка на robots.txt пропускат, и това е разликата между отгатването защо дадена страница не се обхожда и знанието със сигурност.