Penguji Robots.txt
Tempelkan file robots.txt, pilih crawler — termasuk GPTBot, ClaudeBot, dan Google-Exended — dan langsung lihat apakah crawler tersebut dapat mengambil jalur URL tertentu, dengan aturan dan nomor baris yang tepat yang menentukannya.
Hasil
File robots.txt tampak mudah dibaca dan ternyata mudah sekali salah: `Larang: /` yang menyimpang di bawah grup Agen-pengguna yang salah dapat secara diam-diam menghapus indeks seluruh situs, sementara aturan yang sepertinya memblokir perayap dapat diganti dengan pola yang lebih panjang dan lebih spesifik di tempat lain dalam file. Alat ini mengimplementasikan kembali algoritme pencocokan aktual yang digunakan mesin telusur dan perayap AI — Protokol Pengecualian Robot de-facto yang diformalkan dalam RFC 9309 dan didokumentasikan oleh Google — alih-alih memperkirakannya dengan pemindaian baris demi baris yang sederhana, sehingga keputusan yang Anda lihat di sini adalah keputusan yang akan dihitung oleh perayap sebenarnya.
Tempelkan konten robots.txt Anda, ketik jalur URL yang ingin Anda periksa (seperti `/admin/` atau `/blog/draft-post`), dan pilih crawler dari daftar paket 20 token agen pengguna nyata. Daftar tersebut sengaja melampaui yang klasik — Googlebot, Bingbot, dan `*` fallback — untuk menyertakan generasi pengikis AI saat ini: GPTBot dan OAI-SearchBot (OpenAI), ClaudeBot dan anthropic-ai (Anthropic), Google-Exended (sinyal penyisihan pelatihan AI Google, terpisah dari perayap penelusuran Googlebot), Applebot-Exended (penyisihan yang setara dengan Apple), PerplexityBot, CCBot (Common Perayapan, yang arsipnya memuat banyak model AI lainnya), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot, dan banyak lagi. Setiap token dikirimkan dengan penjelasan singkat dan jujur tentang apa sebenarnya token tersebut.
Algoritmenya sendiri mengikuti spesifikasi dengan tepat: grup agen-pengguna dicocokkan tanpa membedakan huruf besar-kecil, dengan pencocokan persis atau awalan pada token produk selalu mengalahkan grup cadangan `*`, dan beberapa blok yang mendeklarasikan token yang sama digabungkan seperti yang dilakukan crawler sebenarnya. Dalam grup pemenang, setiap aturan Izinkan dan Larang diperiksa terhadap jalurnya menggunakan semantik wildcard yang tepat (`*` cocok dengan urutan apa pun, `$` di akhir jalur mengarah ke ujung jalur), dan pola pencocokan terpanjang menang — dengan Izinkan memenangkan seri apa pun melawan Disallow dengan panjang yang sama, persis seperti yang didokumentasikan oleh penerapan robots.txt milik Google sendiri.
Panel hasil tidak hanya mengatakan DIPERBOLEHKAN atau DIBLOKIR — panel ini memberi nama baris yang tepat dan teks aturan yang bertanggung jawab, sehingga Anda dapat langsung kembali ke file Anda dan memperbaiki (atau mengonfirmasi) arahan yang penting. Ini adalah detail yang dilewati sebagian besar pemeriksa robots.txt, dan inilah perbedaan antara menebak mengapa halaman tidak dirayapi dan mengetahui secara pasti.