0

Тестер на Robots.txt

Поставете файл robots.txt, изберете обхождащ бот – включително GPTBot, ClaudeBot и Google-Extended – и незабавно вижте дали може да извлече даден URL път, заедно с точното правило и номер на ред, които са го определили.

🔒 Обработва се изцяло във вашия браузър - нищо, което въвеждате тук, никога не се качва.

Обработка... 0%
Анализиране на robots.txt
Съпоставяне на правила за обхождащия бот
Готово

Резултат

Файлът robots.txt е измамно лесен за четене и изненадващо лесен за сбъркване: едно неволно `Disallow: /` под грешна група User-agent може тихо да деиндексира цял сайт, докато правило, което изглежда, че блокира даден бот, може да бъде отменено от по-дълъг, по-специфичен шаблон другаде във файла. Този инструмент преимплементира действителния алгоритъм за съпоставяне, използван от търсачките и AI обхождащите ботове – де факто протоколът за изключване на роботи (Robots Exclusion Protocol), формализиран в RFC 9309 и документиран от Google – вместо да го апроксимира с просто сканиране ред по ред, така че резултатът, който виждате тук, е резултатът, който реален обхождащ бот би изчислил.

Поставете съдържанието на вашия robots.txt, въведете URL пътя, който искате да проверите (като `/admin/` или `/blog/draft-post`), и изберете обхождащ бот от вграден списък с 20 реални user-agent токена. Този списък умишлено надхвърля класическите – Googlebot, Bingbot и резервния `*` – за да включи настоящото поколение AI скрейпъри: GPTBot и OAI-SearchBot (OpenAI), ClaudeBot и anthropic-ai (Anthropic), Google-Extended (сигналът за отказ от обучение на AI на Google, отделен от обхождащия бот за търсене Googlebot), Applebot-Extended (еквивалентният отказ на Apple), PerplexityBot, CCBot (Common Crawl, чийто архив захранва много други AI модели), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot и други. Всеки токен идва с кратко, честно обяснение какво всъщност представлява.

Самият алгоритъм следва спецификацията прецизно: групите за user-agent се съпоставят без значение от регистъра, като точното или префиксното съвпадение на токена на продукта винаги превъзмогва резервната група `*`, а множество блокове, деклариращи същия токен, се сливат, както правят реалните обхождащи ботове. В рамките на печелившата група всяко правило Allow и Disallow се проверява спрямо пътя, използвайки правилна семантика на заместващи символи (`*` съвпада с всякаква последователност, завършващ `$` закотвя към края на пътя), като най-дългият съвпадащ шаблон печели – като Allow печели всеки равен резултат срещу Disallow със същата дължина, точно както е документирано в собствената имплементация на robots.txt на Google.

Панелът с резултата не казва просто ALLOWED или BLOCKED – той посочва точния ред и текст на правилото, отговорни за резултата, така че да можете да се върнете директно във файла си и да поправите (или потвърдите) директивата, която има значение. Това е детайлът, който повечето проверяващи robots.txt пропускат, и той е разликата между това да гадаете защо дадена страница не се обхожда и да знаете със сигурност.