Тестер robots.txt
Вставте вміст robots.txt, оберіть краулера — включно з GPTBot, ClaudeBot і Google-Extended — і миттєво дізнайтеся, чи може він завантажити вказаний шлях URL, з точним правилом і номером рядка, який це визначив.
Результат
Файл robots.txt виглядає оманливо простим для читання і напрочуд легко піддається помилкам: випадковий `Disallow: /` не в тій групі User-agent може непомітно вивести весь сайт з індексу, а правило, яке нібито блокує краулера, може бути перекрите довшим і специфічнішим патерном десь далі у файлі. Цей інструмент реалізує справжній алгоритм зіставлення, яким користуються пошукові системи та AI-краулери, — де-факто стандарт Robots Exclusion Protocol, формалізований у RFC 9309 і задокументований Google, — а не наближає його простим посимвольним скануванням рядків, тож вердикт, який ви бачите тут, — це той самий вердикт, який обчислив би справжній краулер.
Вставте вміст свого robots.txt, введіть шлях URL, який хочете перевірити (наприклад, `/admin/` або `/blog/draft-post`), і оберіть краулера зі вбудованого списку з 20 реальних токенів user-agent. Цей список навмисно виходить за межі класики — Googlebot, Bingbot і резервний `*` — і включає поточне покоління AI-скрейперів: GPTBot і OAI-SearchBot (OpenAI), ClaudeBot і anthropic-ai (Anthropic), Google-Extended (сигнал відмови від навчання AI Google, окремий від пошукового краулера Googlebot), Applebot-Extended (аналогічна відмова Apple), PerplexityBot, CCBot (Common Crawl, чий архів живить багато інших AI-моделей), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot та інші. Кожен токен супроводжується коротким чесним поясненням того, чим він насправді є.
Сам алгоритм точно відповідає специфікації: групи user-agent зіставляються регістронезалежно, причому точний або префіксний збіг токена продукту завжди перемагає резервну групу `*`, а кілька блоків з однаковим токеном об'єднуються так само, як це роблять справжні краулери. У переможній групі кожне правило Allow і Disallow перевіряється проти шляху за правильною семантикою шаблонів (`*` відповідає будь-якій послідовності, кінцевий `$` прив'язує до кінця шляху), і перемагає найдовший відповідний патерн — причому Allow перемагає у будь-якій нічиї з Disallow однакової довжини, точно як задокументовано у власній реалізації robots.txt від Google.
Панель результату не просто пише ALLOWED чи BLOCKED — вона називає точний рядок і текст правила, відповідального за це, тож ви можете одразу повернутися до свого файлу і виправити (або підтвердити) потрібну директиву. Це та деталь, яку пропускає більшість перевірок robots.txt, і саме вона є різницею між здогадками про те, чому сторінка не сканується, і точним знанням.