1. Nguồn
Tải trực tiếp robots.txt. Kết quả xác định nguồn gốc của bằng chứng.
Kiểm tra và xác thực các quy tắc robots.txt, chỉ thị User-Agent, các đường dẫn bị chặn và chính sách truy cập của bot AI dành cho công cụ tìm kiếm và crawler AI.
Gửi một URL công khai, tên miền, hoặc từ khóa. Novaverb sẽ chỉ hiển thị bằng chứng mà công cụ này thực sự có thể lấy hoặc đo lường.
Kiểm tra này ghi nhận tệp robots.txt ở thư mục gốc của đúng tên máy chủ đã gửi và báo cáo trạng thái HTTP, số dòng không phải chú thích, các giá trị user-agent, số lượng Allow và Disallow, các khai báo sitemap cùng bất kỳ quy tắc Disallow: / nguyên văn nào. Nó không mô phỏng một crawler cụ thể theo tên đối với một URL cụ thể.
Tải trực tiếp robots.txt. Kết quả xác định nguồn gốc của bằng chứng.
Công cụ tải /robots.txt và đọc các chỉ thị trong đó. robots.txt là chỉ thị thu thập dữ liệu, không phải kiểm soát truy cập hay lệnh gỡ khỏi chỉ mục; công cụ này không mô phỏng chính sách của một trình thu thập cụ thể.
Sử dụng phát hiện để xác minh một vấn đề, sau đó kết nối một không gian làm việc khi bạn cần lịch sử, giám sát hoặc phân tích toàn bộ trang web.
robots.txt cho các crawler tuân thủ biết chúng được phép yêu cầu những đường dẫn nào. Đây là tệp đầu tiên mà hầu hết crawler tải về, nên chỉ một dòng sai cũng có thể âm thầm khiến cả website nằm ngoài kết quả tìm kiếm - hoặc để các đường dẫn riêng tư bị thu thập dữ liệu.
Một robots.txt rõ ràng giúp giảm sự mơ hồ cho các crawler tìm kiếm và AI. Novaverb có thể dùng tín hiệu này như một phần của mô hình bằng chứng kỹ thuật và thu thập dữ liệu rộng hơn, bên cạnh khả năng lập chỉ mục, thẻ canonical và liên kết nội bộ.
Gửi miền, hoặc bất kỳ URL nào trên đó; máy chủ được giải quyết và robots.txt được lấy từ gốc, đó là vị trí duy nhất mà thông số kỹ thuật công nhận. Một tệp đặt trong một thư mục con không phải là robots.txt và sẽ được báo cáo là thiếu, điều này cũng là kết luận mà mọi crawler thực sự đạt được.
yourdomain.comBất kỳ hình thức địa chỉ nào cũng hoạt động - chúng tôi lấy /robots.txt tại gốc máy chủ cho bạn. http hoặc https, có hoặc không có www, chỉ tên miền hay một đường dẫn đầy đủ - chúng tôi chuẩn hóa cho bạn.https://www.yourdomain.com/anythingNgay cả một URL ở tầng sâu cũng được; chúng tôi quy về máy chủ và đọc robots.txt ở gốc của máy chủ đó.Expecting a subfolder robots.txt to countrobots.txt chỉ có hiệu lực tại thư mục gốc của máy chủ; bản sao đặt trong thư mục con sẽ bị crawler bỏ qua.Tên máy chủ chính xác được phân giải thành một địa chỉ công khai và /robots.txt được lấy về với cơ chế xử lý redirect an toàn. Văn bản trả về được đếm theo chỉ thị và theo user-agent; giá trị Disallow để trống vẫn được coi là cho phép, và chỉ quy tắc chặn gốc đúng nghĩa đen mới bị đánh dấu là chặn toàn bộ trang web.
RFC 9309 định nghĩa cú pháp Robots Exclusion Protocol dùng để xác định các dòng User-agent, Allow, Disallow và Sitemap. Bản tóm tắt này không tuyên bố có triển khai việc khớp riêng theo từng crawler, cơ chế cache hay các phần mở rộng chính sách ngoài những trường mà nó hiển thị.
Xác định các chỉ thị User-agent, Allow, Disallow và Sitemap đã thu thập, và coi một Disallow trống là cho phép.
Đọc thông số kỹ thuậtIt fetches your /robots.txt file, reports the HTTP status, and lists crawl rules grouped by user-agent, counting every Allow and Disallow directive plus any declared Sitemap lines so you see exactly what crawlers are told.
Robots.txt is a plain-text file at your domain root that follows the Robots Exclusion Protocol (RFC 9309). It tells cooperating crawlers like Googlebot which paths they may or may not request, grouped by user-agent.
No. A line containing Disallow: with no path allows all paths for that group. Disallow: / is the rule that blocks the root and every path beneath it.
No. It lists the groups and directives captured in the file. It does not reproduce a named crawler's complete matching, caching or policy behavior for a submitted URL.
No. The file is public and its rules are voluntary. Protect private paths with authentication and authorization; use robots.txt only to communicate crawl preferences to cooperating crawlers.
A 200 OK means the file was served and its rules apply. A 404 means no file exists, so crawlers assume full access. Persistent 5xx errors can cause crawlers to pause crawling entirely.
Disallow lists paths crawlers should not request; Allow re-permits a sub-path inside a broader Disallow. The most specific matching rule wins, so Allow can carve exceptions out of a blocked directory.
Yes. A Sitemap: directive with the full URL helps crawlers discover your XML sitemap independently of any submission. The checker reports every Sitemap line it finds so you can confirm it is declared.
No. Robots.txt is a public, voluntary instruction for cooperating crawlers, not access control. Anyone can read it, and it cannot protect private content. Use authentication or server rules to actually restrict access.
It parses and reports your directives as written, but it does not replicate any single crawler's full internal matching policy. Treat the grouped rules and counts as an accurate readout, not a crawler-specific simulation.