Công cụ miễn phí, không cần tài khoản

Kiểm tra & Xác thực robots.txt miễn phí

Kiểm tra và xác thực các quy tắc robots.txt, chỉ thị User-Agent, các đường dẫn bị chặn và chính sách truy cập của bot AI dành cho công cụ tìm kiếm và crawler AI.

Còn được gọi là: kiểm tra robots.txt, xác thực
Bằng chứng được hiển thị với nguồnKhông cần tài khoảnKhông có chỉ số nào được tạo ra.

Chạy một kiểm tra thực tế ở trên

Gửi một URL công khai, tên miền, hoặc từ khóa. Novaverb sẽ chỉ hiển thị bằng chứng mà công cụ này thực sự có thể lấy hoặc đo lường.

Mô hình bằng chứng

Biết điều gì mà kết quả chứng minh

Kiểm tra này ghi nhận tệp robots.txt ở thư mục gốc của đúng tên máy chủ đã gửi và báo cáo trạng thái HTTP, số dòng không phải chú thích, các giá trị user-agent, số lượng Allow và Disallow, các khai báo sitemap cùng bất kỳ quy tắc Disallow: / nguyên văn nào. Nó không mô phỏng một crawler cụ thể theo tên đối với một URL cụ thể.

1. Nguồn

Tải trực tiếp robots.txt. Kết quả xác định nguồn gốc của bằng chứng.

2. Ranh giới

Công cụ tải /robots.txt và đọc các chỉ thị trong đó. robots.txt là chỉ thị thu thập dữ liệu, không phải kiểm soát truy cập hay lệnh gỡ khỏi chỉ mục; công cụ này không mô phỏng chính sách của một trình thu thập cụ thể.

3. Hành động tiếp theo

Sử dụng phát hiện để xác minh một vấn đề, sau đó kết nối một không gian làm việc khi bạn cần lịch sử, giám sát hoặc phân tích toàn bộ trang web.

Giải thích Robots.txt

Kiểm tra robots.txt của bạn mà không tuyên bố quá mức những gì nó làm

robots.txt cho các crawler tuân thủ biết chúng được phép yêu cầu những đường dẫn nào. Đây là tệp đầu tiên mà hầu hết crawler tải về, nên chỉ một dòng sai cũng có thể âm thầm khiến cả website nằm ngoài kết quả tìm kiếm - hoặc để các đường dẫn riêng tư bị thu thập dữ liệu.

Điều gì cần kiểm tra

  • Địa điểm - tệp phải nằm ở gốc tên miền và trả về HTTP 200 dưới dạng văn bản thuần.
  • Nhóm tác nhân người dùng - các quy tắc Allow/Disallow của mỗi nhóm chỉ áp dụng cho các tác nhân mà nó chỉ định; một Disallow trống sau User-agent: * có thể chặn mọi thứ.
  • Các sitemap đã khai báo - xuất bản URL tuyệt đối của sơ đồ trang tại đây để các trình thu thập có thể phát hiện nó.
  • Ranh giới xác thực - trang này kiểm tra khả năng truy cập qua HTTP và bằng chứng về các chỉ thị; nó không phải là một trình phân tích cú pháp RFC 9309 đầy đủ hay một lượt kiểm tra trong Search Console.

Tại sao điều này quan trọng cho SEO và phát hiện AI

Một robots.txt rõ ràng giúp giảm sự mơ hồ cho các crawler tìm kiếm và AI. Novaverb có thể dùng tín hiệu này như một phần của mô hình bằng chứng kỹ thuật và thu thập dữ liệu rộng hơn, bên cạnh khả năng lập chỉ mục, thẻ canonical và liên kết nội bộ.

Nhận câu trả lời đúng

Điều gì cần gửi - và điều gì cần tránh

Gửi miền, hoặc bất kỳ URL nào trên đó; máy chủ được giải quyết và robots.txt được lấy từ gốc, đó là vị trí duy nhất mà thông số kỹ thuật công nhận. Một tệp đặt trong một thư mục con không phải là robots.txt và sẽ được báo cáo là thiếu, điều này cũng là kết luận mà mọi crawler thực sự đạt được.

Sử dụng nó như thế này
yourdomain.comBất kỳ hình thức địa chỉ nào cũng hoạt động - chúng tôi lấy /robots.txt tại gốc máy chủ cho bạn. http hoặc https, có hoặc không có www, chỉ tên miền hay một đường dẫn đầy đủ - chúng tôi chuẩn hóa cho bạn.
https://www.yourdomain.com/anythingNgay cả một URL ở tầng sâu cũng được; chúng tôi quy về máy chủ và đọc robots.txt ở gốc của máy chủ đó.
Tránh điều này
Expecting a subfolder robots.txt to countrobots.txt chỉ có hiệu lực tại thư mục gốc của máy chủ; bản sao đặt trong thư mục con sẽ bị crawler bỏ qua.
Phương pháp công khai

Chính xác cách kết quả này được sản xuất

Tên máy chủ chính xác được phân giải thành một địa chỉ công khai và /robots.txt được lấy về với cơ chế xử lý redirect an toàn. Văn bản trả về được đếm theo chỉ thị và theo user-agent; giá trị Disallow để trống vẫn được coi là cho phép, và chỉ quy tắc chặn gốc đúng nghĩa đen mới bị đánh dấu là chặn toàn bộ trang web.

  1. Chúng tôi giữ nguyên chính xác tên máy chủ đã gửi và lấy /robots.txt từ gốc của nó với cơ chế xử lý redirect an toàn.
  2. Chúng tôi đếm các chỉ thị User-agent, Allow, Disallow và Sitemap từ tệp đã thu thập.
  3. Chúng tôi đánh dấu một khối gốc Disallow: / và giữ giá trị Disallow trống là cho phép; chúng tôi không mô phỏng chính sách đầy đủ của một trình thu thập tên.
Xây dựng trên các tiêu chuẩn công khai

Các tiêu chuẩn quốc tế mà kiểm tra này áp dụng

RFC 9309 định nghĩa cú pháp Robots Exclusion Protocol dùng để xác định các dòng User-agent, Allow, Disallow và Sitemap. Bản tóm tắt này không tuyên bố có triển khai việc khớp riêng theo từng crawler, cơ chế cache hay các phần mở rộng chính sách ngoài những trường mà nó hiển thị.

IETFRFC 9309
Robots Exclusion Protocol

Xác định các chỉ thị User-agent, Allow, Disallow và Sitemap đã thu thập, và coi một Disallow trống là cho phép.

Đọc thông số kỹ thuật
Chúng tôi chỉ liệt kê một tiêu chuẩn khi công cụ này thực sự đọc hoặc đo lường theo đó. Khi một tín hiệu nằm ngoài kiểm tra trực tiếp, kết quả sẽ nói rõ điều đó thay vì ngụ ý rằng có sự bao phủ.
Câu hỏi thường gặp

Trình kiểm tra robots.txt Câu hỏi thường gặp

What does the Robots.txt Checker check?

It fetches your /robots.txt file, reports the HTTP status, and lists crawl rules grouped by user-agent, counting every Allow and Disallow directive plus any declared Sitemap lines so you see exactly what crawlers are told.

What is robots.txt?

Robots.txt is a plain-text file at your domain root that follows the Robots Exclusion Protocol (RFC 9309). It tells cooperating crawlers like Googlebot which paths they may or may not request, grouped by user-agent.

Does an empty Disallow rule block the whole site?

No. A line containing Disallow: with no path allows all paths for that group. Disallow: / is the rule that blocks the root and every path beneath it.

Does the checker decide whether one named crawler may fetch a URL?

No. It lists the groups and directives captured in the file. It does not reproduce a named crawler's complete matching, caching or policy behavior for a submitted URL.

Can robots.txt protect private content?

No. The file is public and its rules are voluntary. Protect private paths with authentication and authorization; use robots.txt only to communicate crawl preferences to cooperating crawlers.

What is a good HTTP status for robots.txt?

A 200 OK means the file was served and its rules apply. A 404 means no file exists, so crawlers assume full access. Persistent 5xx errors can cause crawlers to pause crawling entirely.

What's the difference between Allow and Disallow?

Disallow lists paths crawlers should not request; Allow re-permits a sub-path inside a broader Disallow. The most specific matching rule wins, so Allow can carve exceptions out of a blocked directory.

Should robots.txt list my sitemap?

Yes. A Sitemap: directive with the full URL helps crawlers discover your XML sitemap independently of any submission. The checker reports every Sitemap line it finds so you can confirm it is declared.

Is robots.txt a security or access-control tool?

No. Robots.txt is a public, voluntary instruction for cooperating crawlers, not access control. Anyone can read it, and it cannot protect private content. Use authentication or server rules to actually restrict access.

Does this checker simulate exactly how Googlebot reads my file?

It parses and reports your directives as written, but it does not replicate any single crawler's full internal matching policy. Treat the grouped rules and counts as an accurate readout, not a crawler-specific simulation.

Nhiều kiểm tra miễn phí hơn

Khám phá tất cả Công cụ Miễn phí của Novaverb

Công cụ kiểm tra SEO websitePhạm vi thu thập dữ liệu, các trang có thể lập chỉ mục và liên kết nội bộ
Công cụ nghiên cứu từ khóaKiểm tra khối lượng tìm kiếm có sẵn của truy …
Trình kiểm tra SERPKiểm tra các kết quả tự nhiên trả về cho …
Công cụ Kiểm tra Bảo mật Trang webRà soát trạng thái bảo mật của trang web, chứng …
Kiểm tra Cấu hình Bảo mật WordPressKiểm tra tám khu vực cấu hình WordPress có thể …
Kiểm tra thời gian phản hồi máy chủĐo thời gian máy chủ trả về byte đầu tiên …
Phân tích BacklinksKiểm tra dữ liệu backlink và tên miền giới thiệu …
Sitemap CheckerPhát hiện các khai báo sitemap, kiểm tra tài liệu …
Trình kiểm tra thẻ metaKiểm tra độ dài tiêu đề trang, mô tả meta, …
Trình kiểm tra trạng thái HTTP và chuyển hướngTruy vết mã trạng thái HTTP (200, 301, 302, 404, …
Giám sát trang webChạy một lượt kiểm tra khả dụng trực tiếp và …
Kiểm tra HTTP/2Kiểm tra xem đúng tên máy chủ đã gửi có …
Kiểm tra HTTP/3Dùng một phép thử bắt tay trực tiếp để kiểm …
Kiểm tra Hiệu suất Trang webSo sánh thời gian phản hồi HTTP từ các vị …
Trình kiểm tra GEOKiểm tra các tín hiệu quan sát được trên trang …
Công cụ kiểm tra Core Web VitalsKiểm tra LCP, INP và CLS của người dùng thực …
Trình kiểm tra PageSpeedChạy một lượt kiểm tra Lighthouse trong phòng thí nghiệm …
Kiểm tra an toàn trang webKiểm tra xem một miền hoặc URL có bị gắn …
Kiểm tra Knowledge GraphTra cứu các thực thể trùng khớp với một thương …
Kiểm tra khoảng cách từ khóaTìm các từ khóa xếp hạng được quan sát cho …
Các trang hàng đầu của đối thủTìm các trang có lưu lượng truy cập tự nhiên …
Kiểm tra → hiểu → sửa

Biến kiểm tra này thành một sửa chữa đã được xác minh

Mỗi công cụ miễn phí của Novaverb là một phễu duy nhất: chạy kiểm tra, hiểu bằng chứng, rồi sửa và chứng minh vấn đề đã được xử lý bằng một lần kiểm tra lại mới - không bịa ra trạng thái đạt.