Cho phép thu thập công khai theo mặc định, thêm quy tắc tùy chỉnh, hoặc rõ ràng chặn thu thập cho một môi trường tạm thời.
Free Robots.txt Generator for SEO & AI Crawlers
Create and test a plain RFC 9309-aligned robots.txt with CMS publishing guidance and optional AI crawler controls. Copy or download it free - no signup.
Chọn chính sách cơ bản, sau đó chỉ thêm các đường dẫn cần có ngoại lệ.
Sử dụng * cho tất cả các crawler hoặc một mã sản phẩm chính xác như Googlebot.
Sử dụng * hoặc một mã sản phẩm chỉ chứa chữ cái, dấu gạch ngang và dấu gạch dưới.
Nhập các đường dẫn trên máy chủ này. Một dấu gạch chéo đầu tiên bị thiếu sẽ được thêm tự động.
Sử dụng một đường dẫn Cho phép cụ thể hơn bên trong một khu vực bị chặn rộng hơn.
Xóa nhận xét, ngắt dòng hoặc ký tự điều khiển khỏi giá trị quy tắc.
Sử dụng các URL http:// hoặc https:// đầy đủ. Các URL sitemap chéo máy chủ được phép.
Mỗi sơ đồ trang phải là một URL HTTP hoặc HTTPS hoàn chỉnh.
Không có nhóm AI nào được thêm vào. Tất cả các trình thu thập dữ liệu quay lại nhóm chính của bạn.
Không có hạn chế nào khớp - thu thập được phép.
Biến đầu ra thành quy trình làm việc được giám sát
Một không gian làm việc Novaverb quét trang trực tiếp của bạn, xác minh rằng các thẻ và tệp này thực sự được phục vụ, theo dõi thay đổi theo thời gian và biến phát hiện thành công việc được giao.
Robots.txt Generator
Điều gì là một trình tạo robots.txt?
Một trình tạo robots.txt tạo ra một chính sách thu thập văn bản thuần cho các tác nhân người dùng tự động trên một máy chủ website. Công cụ này xây dựng các bản ghi User-agent, Cho phép, Không cho phép và Sitemap trong trình duyệt của bạn và cho phép bạn kiểm tra một đường dẫn trước khi xuất bản.
Tạo và xác minh robots.txt trong năm bước
Tệp và trình kiểm tra được cập nhật ngay lập tức mà không cần tải lên quy tắc của bạn.
Sử dụng * cho tất cả các crawler tuân thủ hoặc nhập mã sản phẩm chính xác cho một crawler.
Không cho phép các đường dẫn rộng và chỉ sử dụng các ngoại lệ cho phép cụ thể hơn khi cần thiết.
Thử các đường dẫn công khai, bị chặn và ngoại lệ. Xem trước xác định quy tắc thắng.
Tải lên robots.txt vào thư mục gốc của máy chủ, sau đó lấy URL trực tiếp và xác nhận phản hồi là hiện tại.
Cách hoạt động của việc khớp quy tắc
Trình kiểm tra tuân theo hành vi khớp chính được xác định bởi Giao thức loại trừ Robots.
Một đường dẫn khớp dài hơn có ưu tiên hơn một quy tắc ngắn hơn, rộng hơn.
Khi các quy tắc Cho phép và Không cho phép tương đương đều khớp, quy tắc Cho phép nên được sử dụng.
/Folder/ và /folder/ là các đường dẫn khác nhau. Kiểm tra cùng một chữ hoa mà máy chủ của bạn sử dụng.
Danh sách kiểm tra tuân thủ RFC 9309
Đây là yêu cầu giao thức và quy tắc xử lý trình thu thập dữ liệu, không phải là truyền thuyết SEO tùy chọn.
§2.3Tệp và vị trí chính xácPhục vụ /robots.txt chữ thường ở cấp cao nhất của mỗi sơ đồ, máy chủ và cổng dưới dạng UTF-8 text/plain.
§2.2.1–2.2.3Nhóm và khớpMã người dùng sử dụng chữ cái, dấu gạch ngang hoặc dấu gạch dưới. Việc khớp là phân biệt chữ hoa chữ thường; quy tắc dài nhất thắng và Allow thắng trong trường hợp hòa.
§2.3.1Kết quả HTTP quan trọngCác crawler nên theo ít nhất năm lần chuyển hướng. Một tệp 4xx có thể có nghĩa là việc thu thập được cho phép; một lỗi 5xx hoặc sự cố mạng có nghĩa là hoàn toàn không cho phép trong khi không thể truy cập.
§2.4–2.5Giới hạn cache và phân tíchMột tệp được lưu cache thường không nên được sử dụng quá 24 giờ, và các trình phân tích phải hỗ trợ ít nhất 500 KiB.
Bắt đầu từ một cơ sở CMS minh bạch
Chọn một nền tảng sẽ tải một khởi đầu có thể nhìn thấy và chỉnh sửa vào robots.txt được tạo. Novaverb không bao giờ thêm chỉ thị ẩn; xác minh phiên bản CMS đã cài đặt trước khi thay thế tệp do nền tảng quản lý.
/robots.txt · /wp-sitemap.xmlWordPress có thể phục vụ cả hai điểm cuối một cách ảo. Kiểm tra phản hồi hiện tại trước vì các plugin có thể thay thế đầu ra lõi; chỉ thêm các quy tắc mà bạn đã xác minh cho trang này.
Tham khảo lõi WordPressweb/robots.txtDrupal Composer Scaffold quản lý tệp gốc. Thêm hoặc vá các quy tắc cụ thể cho dự án thông qua cấu hình scaffold để các bản cập nhật lõi không xóa chúng một cách âm thầm.
Hướng dẫn khung Drupalrobots.txt.dist → robots.txtSử dụng tệp đơn giản được cung cấp với phiên bản Joomla chính xác của bạn làm nguồn nền tảng hiện tại. Không nhập danh sách đường dẫn từ một phiên bản cũ hơn hoặc một trang web khác.
Tệp lõi Joomlatemplates/robots.txt.liquidShopify đã phục vụ một mặc định hướng SEO. Tùy chỉnh mẫu Liquid chỉ khi cần thiết; thay thế hoàn toàn tệp được tạo có thể loại bỏ các bản cập nhật nền tảng trong tương lai.
Hướng dẫn Shopifyapp/robots.tsSử dụng quy ước MetadataRoute.Robots cho đầu ra tĩnh hoặc động có kiểu, hoặc thêm app/robots.txt cho tệp tĩnh đơn giản.
Tham khảo robots Next.jspublic root or explicit /robots.txt routeCác khung này không ngụ ý một bộ quy tắc SEO toàn cầu. Phục vụ văn bản được tạo từ gốc công khai hoặc một tuyến đường text/plain và kiểm tra máy chủ sản xuất.
Chọn quyền truy cập AI theo mục đích
Tính khả dụng tìm kiếm, phát triển mô hình và truy xuất theo yêu cầu của người dùng là những quyết định khác nhau. Tên nhà cung cấp và chính sách có thể thay đổi, vì vậy hãy kiểm tra lại nguồn liên kết trước khi xuất bản.
OAI-SearchBot, Claude-SearchBot, PerplexityBotChặn những điều này có thể giảm khả năng phát hiện, đoạn trích, trích dẫn hoặc chất lượng kết quả tìm kiếm trong các sản phẩm AI tương ứng.
GPTBot, ClaudeBot, Google-ExtendedCác điều khiển được đặt tên này liên quan đến việc đào tạo mô hình tiềm năng, cải thiện mô hình hoặc định hướng Gemini. Google-Extended không ảnh hưởng đến việc bao gồm hoặc xếp hạng tìm kiếm của Google.
Một quy tắc user-agent không phải là xác minh danh tính, kiểm soát truy cập hoặc một lựa chọn từ chối toàn cầu. Xem tài liệu của nhà cung cấp và xác thực lưu lượng thực một cách riêng biệt.
Sử dụng điều khiển đúng cho công việc
robots.txt là một sở thích thu thập, không phải là kiểm soát truy cập hoặc một lệnh lập chỉ mục đảm bảo.
Sử dụng tốt
- Giảm thu thập dữ liệu của các bộ lọc trùng lặp, giỏ hàng và các đường dẫn tiện ích có giá trị thấp.
- Tiết lộ một hoặc nhiều URL sơ đồ trang tuyệt đối.
- Tạo các quy tắc cụ thể cho các trình thu thập tự nhận diện và tôn trọng giao thức.
Không được đảm bảo bởi robots.txt
- Giữ nội dung nhạy cảm riêng tư - sử dụng xác thực và ủy quyền.
- Xóa một URL khỏi tìm kiếm - sử dụng phản hồi noindex có thể lập chỉ mục, quy trình xóa hoặc kiểm soát truy cập khi thích hợp.
- Buộc mọi trình thu thập hoặc hệ thống AI tuân thủ - giao thức là tư vấn.
Đã tạo không giống như trực tiếp
Một bản nháp chính xác vẫn có thể được tải lên máy chủ sai, lưu cache, chuyển hướng hoặc phục vụ với lỗi. Sau khi xuất bản, lấy tệp thực, xác minh trạng thái HTTP của nó và xác nhận rằng các chỉ thị Sitemap được giải quyết.
Robots.txt Generator Câu hỏi thường gặp
robots.txt làm gì?
robots.txt cho các crawler tuân thủ biết các đường dẫn URL nào họ có thể yêu cầu trên một sơ đồ, máy chủ và cổng cụ thể. Nó quản lý việc thu thập; nó không phải là xác thực và không đảm bảo rằng một URL được phát hiện sẽ không nằm trong chỉ mục.
robots.txt nên được đặt ở đâu?
Đặt nó ở gốc của máy chủ chính xác, ví dụ https://example.com/robots.txt. Một tệp trong thư mục con không kiểm soát toàn bộ máy chủ, và các quy tắc không tự động chuyển giao giữa các miền phụ.
robots.txt có ngăn Google lập chỉ mục không?
Không. Một URL bị chặn vẫn có thể được phát hiện từ các liên kết và có thể xuất hiện mà không có đoạn trích. Sử dụng chỉ thị noindex phù hợp khi bạn cần kiểm soát lập chỉ mục, và không chặn trình thu thập đọc chỉ thị đó.
Google có hỗ trợ Crawl-delay không?
Không. Google tài liệu User-agent, Allow, Disallow và Sitemap là các trường robots.txt được hỗ trợ và không hỗ trợ Crawl-delay, vì vậy trình tạo này cố ý không thêm nó.
Quy tắc nào thắng khi cả Cho phép và Không cho phép đều khớp?
Đường dẫn khớp chính xác nhất sẽ thắng. Nếu quy tắc Cho phép và Không cho phép tương đương, quy tắc Cho phép sẽ thắng. Việc khớp là phân biệt chữ hoa chữ thường.
Tôi có thể thêm sơ đồ trang vào robots.txt không?
Có. Thêm một hoặc nhiều URL sitemap HTTP hoặc HTTPS đầy đủ. Giá trị Sitemap phải là tuyệt đối, và nó có thể chỉ đến một máy chủ khác.
robots.txt có thể chặn các trình thu thập AI không?
Bạn có thể nhắm mục tiêu một crawler xác định bản thân bằng mã sản phẩm, nhưng chỉ các crawler nhận ra và tôn trọng Giao thức loại trừ Robots mới tuân thủ. Đừng coi tệp này như một bảo đảm chống lại việc truy cập, đào tạo hoặc tái sử dụng.
Tôi nên cho phép hoặc chặn những trình thu thập dữ liệu AI nào?
Quyết định theo mục đích. OAI-SearchBot, Claude-SearchBot và PerplexityBot hỗ trợ phát hiện tìm kiếm hoặc trích dẫn; GPTBot, ClaudeBot và Google-Extended cung cấp các điều khiển riêng biệt liên quan đến phát triển mô hình hoặc cơ sở Gemini. Chính sách thay đổi, vì vậy hãy xác minh tài liệu hiện tại của từng nhà cung cấp trước khi xuất bản.
Tôi có nên thay thế robots.txt mặc định trong WordPress, Drupal, Joomla hay Shopify không?
Thường thì không. Bắt đầu từ tệp hoặc đầu ra ảo được duy trì bởi phiên bản nền tảng đã cài đặt, sau đó chỉ thêm các thay đổi cụ thể cho dự án đã được xác minh. Shopify khuyến nghị bảo tồn các mặc định Liquid được tạo của nó, trong khi Drupal Composer Scaffold có thể quản lý và cập nhật tệp gốc.
Dữ liệu của tôi có được tải lên đâu không?
Không. Trình tạo này chạy hoàn toàn ở phía khách hàng trong trình duyệt của bạn. Không có gì bạn nhập được gửi đến máy chủ, vì vậy nó an toàn để sử dụng trên nội dung riêng tư.
Nó có thực sự miễn phí không?
Có, không cần tài khoản. Một không gian làm việc của Novaverb chỉ cần thiết khi bạn muốn xác minh, theo dõi và theo dõi các tệp này trên trang web trực tiếp của bạn theo thời gian.