0

Robots.txt テスター

robots.txtファイルを貼り付け、GPTBot、ClaudeBot、Google-Extendedを含むクローラーを選択すると、指定されたURLパスにアクセスできるかどうかと、その判定を下した正確なルールと行番号が即座に表示されます。

🔒 ブラウザ内で完全に処理されます。ここに入力した内容はアップロードされません。

処理中... 0%
robots.txtを解析中
クローラールールを照合中
完了

結果

robots.txtファイルは一見シンプルに見えますが、間違えやすいものです。誤ったUser-agentグループの下にあるひとつの`Disallow: /`がサイト全体を密かにインデックスから削除してしまう可能性がある一方で、クローラーをブロックしているように見えるルールが、ファイル内の別の場所にあるより長く具体的なパターンによって上書きされることもあります。このツールは、検索エンジンやAIクローラーが実際に使用しているマッチングアルゴリズム(RFC 9309で正式化され、Googleによって文書化された事実上のRobots Exclusion Protocol)を再実装しており、単純な行ごとのスキャンで近似しているわけではありません。そのため、ここで表示される判定は、実際のクローラーが計算する判定と同じものです。

お手持ちのrobots.txtの内容を貼り付け、確認したいURLパス(`/admin/`や`/blog/draft-post`など)を入力し、20種類の実在するユーザーエージェントトークンのリストからクローラーを選択してください。このリストには、従来からのGooglebot、Bingbot、`*`フォールバックに加えて、現在のAIスクレイパーも意図的に含まれています:GPTBotとOAI-SearchBot(OpenAI)、ClaudeBotとanthropic-ai(Anthropic)、Google-Extended(Googlebotの検索クローラーとは別の、GoogleのAI学習オプトアウトシグナル)、Applebot-Extended(Appleの同等のオプトアウト)、PerplexityBot、CCBot(多くのAIモデルの学習データとなる公開ウェブアーカイブを構築するCommon Crawl)、Bytespider(ByteDance)、Meta-ExternalAgent、Amazonbotなどです。各トークンには、それが実際に何であるかについての短く正直な説明が付いています。

アルゴリズム自体は仕様に正確に従っています。ユーザーエージェントグループのマッチングは大文字と小文字を区別せずに行われ、プロダクトトークンとの完全一致または前方一致は常に`*`フォールバックグループよりも優先され、同じトークンを宣言する複数のブロックは実際のクローラーと同様にマージされます。選択されたグループ内では、すべてのAllowおよびDisallowルールが、適切なワイルドカードセマンティクス(`*`は任意のシーケンスに一致し、末尾の`$`はパスの末尾に固定)を使用してパスと照合され、最も長く一致するパターンが優先されます。同じ長さの場合は、Google自身のrobots.txt実装で文書化されている通り、AllowがDisallowよりも優先されます。

結果パネルには、単に「許可」または「ブロック」と表示されるだけではありません。その判定を下した正確な行とルールテキストが表示されるため、ファイルに直接戻って、問題のディレクティブを修正(または確認)できます。これこそが、ほとんどのrobots.txtチェッカーが見落としている詳細であり、ページがクロールされない理由を推測するのと、確実に知ることの違いです。