1. Nguồn
Lấy robots.txt và sitemap trực tiếp. Kết quả xác định nguồn gốc của bằng chứng.
Phát hiện các khai báo sitemap, kiểm tra tài liệu gốc và lấy một mẫu có giới hạn gồm các sitemap con hoặc các mục URL.
Gửi một URL công khai, tên miền, hoặc từ khóa. Novaverb sẽ chỉ hiển thị bằng chứng mà công cụ này thực sự có thể lấy hoặc đo lường.
Kiểm tra có giới hạn này phát hiện các URL sitemap từ robots.txt hoặc từ đường dẫn /sitemap.xml thông thường, xác định đó là một tập URL hay một sitemap index, và đếm số mục loc đã thu thập được. Nó xem xét tối đa 20 tài liệu sitemap và hiển thị tối đa 100 mục từ một tập URL; đây không phải là một trình xác thực XML hoàn chỉnh hay một lần thu thập dữ liệu URL.
Lấy robots.txt và sitemap trực tiếp. Kết quả xác định nguồn gốc của bằng chứng.
Công cụ kiểm tra xem xét tối đa 20 tài liệu sitemap và hiển thị tối đa 100 mục URL từ một tập URL duy nhất. Công cụ không thu thập dữ liệu mọi URL được liệt kê và cũng không chứng minh việc thu thập dữ liệu hay việc lập chỉ mục.
Sử dụng phát hiện để xác minh một vấn đề, sau đó kết nối một không gian làm việc khi bạn cần lịch sử, giám sát hoặc phân tích toàn bộ trang web.
Một sitemap XML cung cấp gợi ý khám phá URL và siêu dữ liệu tùy chọn về độ mới. Nó giúp các crawler tìm kiếm và AI tìm ra tập URL mà bạn muốn, nhưng không buộc bất kỳ URL nào phải được thu thập dữ liệu hay lập chỉ mục.
Một sơ đồ trang web sạch, có thể truy cập và được khai báo rõ ràng giúp bộ URL dự kiến của một trang web dễ dàng được phát hiện hơn. Novaverb có thể so sánh sơ đồ trang web với bằng chứng thực tế về việc thu thập và khả năng lập chỉ mục như một phần của mô hình kỹ thuật rộng hơn.
Gửi địa chỉ của một website công khai. Tên máy chủ và giao thức chính xác được giữ nguyên để kiểm tra robots.txt và đường dẫn sitemap thông thường. Các mục tiêu riêng tư và đích redirect không an toàn sẽ bị từ chối. Công cụ kiểm tra miễn phí hiện tại không coi một đường dẫn tùy ý được gửi lên là chỉ định ghi đè trực tiếp tới tệp sitemap.
yourdomain.comĐưa vào một tên miền và chúng tôi sẽ tìm ra sitemap; hoặc dán trực tiếp URL của sitemap. http hoặc https, có hoặc không có www, chỉ tên miền hay một đường dẫn đầy đủ - chúng tôi chuẩn hóa cho bạn.https://yourdomain.com/sitemap_index.xmlMột chỉ mục sitemap chỉ đến các sitemap con cũng được xử lý.An HTML page that lists linksMột 'trang sitemap' của con người không phải là một sitemap XML; trình xác thực mong đợi định dạng giao thức XML.robots.txt được lấy trước để tìm các khai báo Sitemap, với /sitemap.xml là phương án dự phòng. Các tài liệu gốc được phân loại theo tên phần tử XML của chúng, một mẫu tài liệu con có giới hạn được lấy về, và các mục loc được đếm. Việc cắt ngắn được nêu rõ trong kết quả thay vì được trình bày như phạm vi đầy đủ.
Giao thức sitemaps.org định nghĩa các phần tử urlset, sitemapindex và loc mà trình kiểm tra này nhận diện, trong khi RFC 9309 định nghĩa việc phát hiện sitemap thông qua robots.txt. Giới hạn kích thước giao thức chỉ là bối cảnh giải thích vì trình kiểm tra giới hạn này không thực hiện xác thực kích thước hoặc sơ đồ đầy đủ.
Nhận diện các phần tử urlset, sitemapindex và loc trong mẫu đã ghi lại giới hạn.
Đọc thông số kỹ thuậtKhám phá các sitemap được khai báo với chỉ thị Sitemap: trong robots.txt.
Đọc thông số kỹ thuậtIt fetches your /sitemap.xml plus any sitemaps declared in robots.txt, then reports the HTTP status, whether the document is a URL set or a sitemap index, how many URLs it declares, and the file size.
An XML sitemap is a file following the sitemaps.org protocol that lists your site's URLs for crawlers. It helps search engines discover pages, especially deep or newly published ones, that internal links alone might surface slowly.
A URL set lists individual page URLs directly. A sitemap index instead lists other sitemap files, letting large sites split millions of URLs across many documents. The checker detects which type your file is.
The sitemaps.org protocol caps a single sitemap at 50,000 URLs and 50MB uncompressed. Beyond that, split URLs across multiple sitemaps and reference them from a sitemap index file.
A sitemap gives crawlers a clean list of URLs you consider important, improving discovery of new and deep pages. It does not guarantee ranking, but it reduces the chance valuable pages go uncrawled.
A 200 OK confirms the sitemap is reachable and served. A 404 means crawlers and this tool cannot find it, so check the path and that it is declared in robots.txt.
No. It reads the sitemap's structure, type, declared URL count, and size. It does not prove any listed URL was crawled or indexed; verify indexing separately in a search engine's coverage report.
It fetches a bounded sample of up to 20 sitemap documents and reports when more were declared than inspected. It does not crawl every listed page or follow unlimited nested sitemap indexes.
Commonly at /sitemap.xml in the domain root, and referenced by a Sitemap: line in robots.txt. The checker fetches both the root path and any robots-declared sitemap URLs it finds.
Large files strain crawlers and hit the 50MB uncompressed protocol limit. The tool reports size so you can see if a bloated sitemap should be split into smaller files under an index.