0

Robots.txt テスター

robots.txt ファイルを貼り付け、GPTBot、ClaudeBot、Google-Extended などのクローラーを選択すると、特定の URL パスを取得できるかどうかを、それを決定した正確なルールと行番号とともに即座に確認できます。

Buy Me a Coffee at ko-fi.com
処理中... 0%
robots.txt を解析しています
クローラールールの一致
完了

結果

robots.txt ファイルは、一見すると読みやすく、驚くほど間違いやすいものです。間違ったユーザー エージェント グループの下にある「Disallow: /」を使用すると、サイレントにサイト全体のインデックスが削除される可能性がありますが、クローラをブロックしているように見えるルールは、ファイル内の別の場所にあるより長くより具体的なパターンによって上書きされる可能性があります。このツールは、単純な行ごとのスキャンでアルゴリズムを近似するのではなく、検索エンジンと AI クローラーが使用する実際のマッチング アルゴリズム (RFC 9309 で形式化され、Google によって文書化された事実上のロボット排除プロトコル) を再実装します。そのため、ここで表示される判定は、実際のクローラーが計算する判定となります。

robots.txt コンテンツを貼り付け、確認したい URL パス (`/admin/` や `/blog/draft-post` など) を入力し、20 個の実際のユーザー エージェント トークンのバンドル リストからクローラーを選択します。このリストには意図的に、Googlebot、Bingbot、および `*` フォールバックといった古典的なものを超えて、GPTBot と OAI-SearchBot (OpenAI)、ClaudeBot と anthropic-ai (Anthropic)、Google-Extended (Googlebot の検索クローラーとは別個の Google の AI トレーニング オプトアウト信号)、Applebot-Extended (Apple の同等のオプトアウト) といった現世代の AI スクレイパーが含まれています。 PerplexityBot、CCBot (Common Crawl、そのアーカイブは他の多くの AI モデルにフィードします)、Bytespider (ByteDance)、Meta-ExternalAgent、Amazonbot などです。すべてのトークンには、それが実際に何であるかについての短く正直な説明が同梱されています。

アルゴリズム自体は仕様に正確に従います。ユーザー エージェント グループは大文字と小文字を区別せずに照合され、製品トークンの完全一致または接頭辞一致が常に `*` フォールバック グループを上回り、同じトークンを宣言する複数のブロックは実際のクローラーと同様にマージされます。勝者グループ内では、すべての許可ルールと不許可ルールが適切なワイルドカード セマンティクスを使用してパスに対してチェックされ (「*」は任意のシーケンスに一致し、末尾の「$」はパスの終わりにアンカーされます)、最も長い一致パターンが勝ちます。これは、Google 独自の robots.txt 実装で文書化されているとおり、同じ長さの Disallow に対して、Allow が同じ長さで勝ちます。

結果パネルには単に ALLOWED または BLOCKED が表示されるだけではなく、原因となる正確な行とルール テキストが示されるため、ファイルに直接戻って重要なディレクティブを修正 (または確認) できます。これは、robots.txt チェッカーのほとんどがスキップする詳細であり、ページがクロールされない理由を推測することと、確実に知ることの違いです。