בודק Robots.txt
הדביקו קובץ robots.txt, בחרו סורק — כולל GPTBot, ClaudeBot ו-Google-Extended — וקבלו מיד תשובה האם הוא יכול להביא נתיב URL נתון, כולל הכלל ומספר השורה המדויקים שהכריעו זאת.
🔒 מעובד כולו בדפדפן שלך - שום דבר שתזין כאן לא יועלה לעולם.
תוצאה
קובץ robots.txt קל להבנה באופן מטעה ומפתיע בקלות לטעות בו: `Disallow: /` תועה תחת קבוצת User-agent לא נכונה עלול להסיר בשקט אתר שלם מהאינדקס, בעוד שכלל שנראה כאילו חוסם סורק עלול להיעקף על ידי תבנית ארוכה וספציפית יותר במקום אחר בקובץ. כלי זה מממש מחדש את האלגוריתם האמיתי שבו משתמשים מנועי חיפוש וסורקי AI — פרוטוקול REP (Robots Exclusion Protocol) כפי שהפך לסטנדרט בפועל ב-RFC 9309 ותועד על ידי גוגל — במקום לקרב אותו בסריקה פשוטה שורה-אחר-שורה, כך שפסק הדין שתראו כאן הוא פסק הדין שסורק אמיתי יחשב.
הדביקו את תוכן ה-robots.txt שלכם, הקלידו את נתיב ה-URL שתרצו לבדוק (כמו `/admin/` או `/blog/draft-post`) ובחרו סורק מרשימה מובנית של 20 מזהי user-agent אמיתיים. הרשימה חורגת במכוון מהקלאסיקה — Googlebot, Bingbot וקבוצת ברירת המחדל `*` — כדי לכלול את הדור הנוכחי של סורקי AI: GPTBot ו-OAI-Searchbot (OpenAI), ClaudeBot ו-anthropic-ai (Anthropic), Google-Extended (האות של גוגל לסירוב מאימון AI, הנפרד מסורק החיפוש Googlebot), Applebot-Extended (האות המקביל של אפל), PerplexityBot, CCBot (Common Crawl, שהארכיון שלו מזין מודלי AI רבים אחרים), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot ועוד. כל מזהה מגיע עם הסבר קצר וכן על מה שהוא באמת עושה.
האלגוריתם עצמו עוקב במדויק אחר המפרט: קבוצות user-agent מותאמות ללא תלות ברישיות, כאשר התאמה מדויקת או התחלתית של מזהה המוצר תמיד גוברת על קבוצת ברירת המחדל `*`, ומספר בלוקים המצהירים על אותו מזהה מאוחדים כפי שסורקים אמיתיים עושים. בתוך הקבוצה המנצחת, כל חוק Allow ו-Disallow נבדק מול הנתיב תוך שימוש בסמנטיקת Wildcard נכונה (`*` מתאים לכל רצף, `$` בסוף מעגן לסוף הנתיב), והתבנית התואמת הארוכה ביותר מנצחת — כש-Allow מנצח כל תיקו מול Disallow באורך זהה, בדיוק כפי שמתועד במימוש ה-robots.txt של גוגל עצמה.
חלונית התוצאה אינה מסתפקת ב-ALLOWED או BLOCKED — היא מציינת במדויק את השורה וטקסט הכלל האחראים, כך שתוכלו לחזור ישירות לקובץ ולתקן (או לאשר) את ההוראה שחשובה. זהו הפרט שרוב בודקי ה-robots.txt מדלגים עליו, והוא ההבדל בין לנחש למה דף אינו נסרק לבין לדעת זאת בוודאות.