0

Trình xác thực Sitemap.xml — Trình kiểm tra tuân thủ giao thức thực

Dán hoặc tải lên sitemap.xml (hoặc chỉ mục sơ đồ trang web) và xác thực nó dựa trên giao thức sitemaps.org thực: phần tử gốc và không gian tên, URL <loc> tuyệt đối, giới hạn 50.000 URL / 50 MB được ghi lại, <lastmod>, <priority>, <changefreq> — cùng với biểu đồ làm mới và phát hiện URL trùng lặp.

🗺️

Kéo và thả file bất kỳ vào đây hoặc click để chọn

hoặc nhấp để duyệt — một tệp .xml duy nhất

Buy Me a Coffee at ko-fi.com
Đang xử lý... 0%
Phân tích cú pháp XML
Kiểm tra các quy tắc giao thức sơ đồ trang web
Phân tích URL
Xong

kết quả

Tệp sitemap.xml có thể là XML có định dạng hoàn hảo nhưng vẫn là sơ đồ trang web bị lỗi: không gian tên xmlns bị thiếu, URL <loc> tương đối, <priority> là "1,5" hoặc <changefreq> là "Daily" thay vì "daily" đều sẽ vượt qua trình xác thực XML chung trong khi âm thầm thất bại giao thức sơ đồ trang web thực tế mà Google, Bing và mọi người dùng tệp khác mong đợi. Công cụ này phân tích sơ đồ trang web đã dán hoặc tải lên của bạn bằng DOMParser gốc của trình duyệt và kiểm tra sơ đồ đó theo các quy tắc thực được xuất bản tại sitemaps.org: phần tử gốc phải là <urlset> đối với sơ đồ trang web thông thường hoặc <sitemapindex> đối với chỉ mục sơ đồ trang web (được phát hiện tự động), lý tưởng nhất là được khai báo với không gian tên chính xác http://www.sitemaps.org/schemas/sitemap/0.9 và mọi <url> (hoặc <sơ đồ trang web>, trong tệp chỉ mục) phải chứa một <loc> phân giải thành URL http/https tuyệt đối chính hãng.

Ngoài cấu trúc, giao thức còn ghi lại các giới hạn cứng và định dạng trường chính xác mà công cụ này kiểm tra từng trường. Một tệp sơ đồ trang web không được liệt kê nhiều hơn 50.000 URL và không được vượt quá 50MB không nén — các giới hạn cũng áp dụng cho tệp chỉ mục sơ đồ trang web, tính các mục nhập <sơ đồ trang web> thay vì các mục nhập <url> — và công cụ này đo lường nội dung được dán/tải lên thực tế của bạn dựa trên cả hai. Mỗi <lastmod>, nếu có, sẽ được kiểm tra theo các định dạng ngày giờ W3C thực mà thông số kỹ thuật chấp nhận: ngày trống (YYYY-MM-DD) hoặc dấu thời gian đầy đủ với giờ, phút, giây tùy chọn và chỉ định múi giờ bắt buộc. Mỗi <ưu tiên>, nếu có, phải là số thập phân trong khoảng từ 0,0 đến 1,0 và mỗi <changefreq> phải chính xác là một trong bảy giá trị mà thông số kỹ thuật xác định — luôn luôn, hàng giờ, hàng ngày, hàng tuần, hàng tháng, hàng năm, không bao giờ — không phải là một từ đồng nghĩa có vẻ hợp lý. Mỗi vi phạm đều nêu tên số mục nhập cụ thể và giá trị thực của nó, giới hạn ở mức 50 người vi phạm được hiển thị cho mỗi quy tắc với ghi chú "+N nữa" để báo cáo vẫn có thể đọc được ngay cả trên sơ đồ trang web gần giới hạn URL.

Hai bước kiểm tra vượt xa những gì giao thức bằng văn bản yêu cầu nhưng phát hiện các vấn đề thực tế, phổ biến: biểu đồ độ mới <lastmod> nhóm mỗi ngày sửa đổi cuối cùng hợp lệ theo tháng để bạn có thể xem nhanh liệu nội dung của trang web có thực sự được cập nhật hay không hay hầu hết các URL đều có dấu thời gian cũ từ nhiều năm trước và trình phát hiện trùng lặp-<loc> gắn cờ bất kỳ URL nào được liệt kê nhiều lần trong cùng một tệp — một tác dụng phụ thường gặp của trình tạo sơ đồ trang web hợp nhất nhiều nguồn mà không loại bỏ trùng lặp. Mọi thứ đều chạy cục bộ: phân tích cú pháp, kiểm tra quy tắc và biểu đồ đều được tính toán trong trình duyệt của bạn từ văn bản bạn đã dán hoặc tệp bạn đã tải lên qua API tệp, không có gì được tìm nạp hoặc tải lên máy chủ và không có URL riêng lẻ nào trong sơ đồ trang web của bạn được yêu cầu hoặc thu thập thông tin — công cụ này tự kiểm tra tài liệu sơ đồ trang web, chứ không phải liệu các trang mà nó liệt kê có thực sự tồn tại hay trả về 200 OK hay không.