0

Robots.txt 测试器

粘贴 robots.txt 文件,选择一个爬虫(包括 GPTBot、ClaudeBot 和 Google-Extended),然后立即查看它是否可以获取给定的 URL 路径,以及决定它的确切规则和行号。

Buy Me a Coffee at ko-fi.com
处理中... 0%
解析robots.txt
匹配爬虫规则
完成

结果

robots.txt 文件看似简单,但很容易出错:错误的用户代理组下的杂散 `Disallow: /` 可以默默地取消整个站点的索引,而看起来阻止爬虫的规则可以被文件中其他地方更长、更具体的模式覆盖。该工具重新实现了搜索引擎和人工智能爬虫使用的实际匹配算法 - RFC 9309 中形式化并由 Google 记录的事实上的机器人排除协议 - 而不是通过简单的逐行扫描来近似它,因此您在这里看到的判决是真正的爬虫会计算的判决。

粘贴您的 robots.txt 内容,输入您要检查的 URL 路径(例如“/admin/”或“/blog/draft-post”),然后从 20 个真实用户代理令牌的捆绑列表中选择一个爬虫。该列表有意超越经典 - Googlebot、Bingbot 和“*”后备 - 包括当前一代的 AI 抓取工具:GPTBot 和 OAI-SearchBot (OpenAI)、ClaudeBot 和 anthropic-ai (Anthropic)、Google-Extended(Google 的 AI 训练选择退出信号,与 Googlebot 的搜索爬虫分开)、Applebot-Extended(Apple 的等效选择退出)、PerplexityBot、CCBot (Common Crawl,其档案为许多其他 AI 模型提供支持)、Bytespider (ByteDance)、Meta-ExternalAgent、Amazonbot 等。每个令牌都附有对其实际含义的简短而诚实的解释。

该算法本身精确地遵循规范:用户代理组不区分大小写进行匹配,产品令牌上的精确匹配或前缀匹配始终击败“*”后备组,并且声明相同令牌的多个块会像真正的爬虫一样进行合并。在获胜组中,每个“允许”和“禁止”规则都使用正确的通配符语义(“*”匹配任何序列,尾随“$”锚定到路径的末尾)对路径进行检查,并且最长的匹配模式获胜——“允许”赢得任何与同等长度的“禁止”的平局,与 Google 自己的 robots.txt 实现所记录的完全一样。

结果面板不仅仅显示“允许”或“阻止”,它还指定了负责的确切行和规则文本,因此您可以直接返回文件并修复(或确认)重要的指令。这是大多数 robots.txt 检查器都会跳过的细节,也是猜测页面不被抓取的原因和确切了解之间的区别。