0

Penguji Robots.txt

Tampalkan fail robots.txt, pilih perangkak — termasuk GPTBot, ClaudeBot dan Google-Extended — dan serta-merta lihat sama ada ia boleh mengambil laluan URL yang diberikan, dengan peraturan dan nombor baris yang tepat yang memutuskannya.

Buy Me a Coffee at ko-fi.com
Memproses... 0%
Menghuraikan robots.txt
Peraturan crawler yang sepadan
Selesai

Hasilnya

Fail robots.txt adalah mudah untuk dibaca dan mudah disalah anggap: `Larang: /` yang tersesat di bawah kumpulan Ejen pengguna yang salah boleh menyah-indeks keseluruhan tapak secara senyap, manakala peraturan yang kelihatan seperti menyekat perangkak boleh diganti dengan corak yang lebih panjang dan lebih khusus di tempat lain dalam fail. Alat ini mengimplementasikan semula enjin carian algoritma pemadanan sebenar dan perangkak AI yang digunakan — Protokol Pengecualian Robot de-facto yang diformalkan dalam RFC 9309 dan didokumenkan oleh Google — dan bukannya menganggarkannya dengan imbasan baris demi baris yang mudah, jadi keputusan yang anda lihat di sini ialah keputusan yang akan dikira perangkak sebenar.

Tampalkan kandungan robots.txt anda, taip laluan URL yang anda mahu semak (seperti `/admin/` atau `/blog/draft-post`), dan pilih perangkak daripada senarai berhimpun 20 token ejen pengguna sebenar. Senarai itu sengaja melangkaui klasik — Googlebot, Bingbot, dan `*` sandaran — untuk menyertakan generasi semasa pengikis AI: GPTBot dan OAI-SearchBot (OpenAI), ClaudeBot dan anthropic-ai (Anthropic), Google-Extended (isyarat ikut serta latihan AI-latihan Google Google, berasingan daripada Googlebots'squid-crawled's, berasingan daripada Googlebots'crawled'sbots. pilih keluar), PerplexityBot, CCBot (Common Crawl, yang arkibnya menyuap banyak model AI lain), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot dan banyak lagi. Setiap token dihantar dengan penjelasan ringkas dan jujur ​​tentang apa sebenarnya.

Algoritma itu sendiri mengikut spesifikasi dengan tepat: kumpulan ejen pengguna dipadankan secara tidak sensitif huruf besar-besaran, dengan padanan tepat atau awalan pada token produk sentiasa mengalahkan kumpulan sandaran `*` dan berbilang blok yang mengisytiharkan token yang sama digabungkan seperti perangkak sebenar. Dalam kumpulan yang menang, setiap peraturan Benarkan dan Tidak Benarkan disemak terhadap laluan menggunakan semantik kad bebas yang betul (`*` sepadan dengan mana-mana jujukan, sauh `$` mengekor ke penghujung laluan) dan corak padanan paling lama menang — dengan Benarkan memenangi sebarang seri menentang Disallow dengan panjang yang sama, sama seperti yang didokumenkan oleh pelaksanaan robots.txt Google sendiri.

Panel keputusan tidak hanya menyatakan DIBENARKAN atau DISEKAT — ia menamakan baris dan teks peraturan yang tepat, supaya anda boleh kembali terus ke fail anda dan membetulkan (atau mengesahkan) arahan yang penting. Itulah perincian yang dilangkau oleh penyemak robots.txt, dan ini adalah perbezaan antara meneka sebab halaman tidak dirangkak dan mengetahui dengan pasti.