Mặc định cho phép thu thập dữ liệu công khai, thêm quy tắc tùy chỉnh, hoặc chặn hẳn việc thu thập dữ liệu đối với một môi trường tạm thời.
Trình tạo robots.txt miễn phí cho SEO & AI Crawlers
Tạo và kiểm tra một robots.txt đơn giản, tuân theo RFC 9309, kèm hướng dẫn xuất bản cho CMS và tùy chọn kiểm soát crawler AI. Sao chép hoặc tải xuống miễn phí - không cần đăng ký.
Chọn chính sách cơ bản, sau đó chỉ thêm các đường dẫn cần có ngoại lệ.
Sử dụng * cho tất cả các crawler hoặc một mã sản phẩm chính xác như Googlebot.
Dùng * hoặc một product token chỉ chứa chữ cái, dấu gạch ngang và dấu gạch dưới.
Nhập các đường dẫn trên máy chủ này. Nếu thiếu dấu gạch chéo ở đầu, hệ thống sẽ tự động thêm vào.
Sử dụng một đường dẫn Cho phép cụ thể hơn bên trong một khu vực bị chặn rộng hơn.
Xóa nhận xét, ngắt dòng hoặc ký tự điều khiển khỏi giá trị quy tắc.
Sử dụng URL http:// hoặc https:// đầy đủ. URL sitemap thuộc máy chủ khác được cho phép.
Mỗi sitemap phải là một URL HTTP hoặc HTTPS đầy đủ.
Sẽ không thêm nhóm AI có tên cụ thể nào. Tất cả crawler quay về áp dụng nhóm chính của bạn.
Không có hạn chế nào khớp - việc thu thập dữ liệu được phép.
Biến đầu ra thành quy trình làm việc được giám sát
Không gian làm việc Novaverb thu thập dữ liệu website đang chạy của bạn, xác minh rằng các thẻ và tệp này thực sự được máy chủ trả về, theo dõi thay đổi theo thời gian và biến các phát hiện thành công việc được giao.
Trình tạo Robots.txt
Điều gì là một trình tạo robots.txt?
Trình tạo robots.txt tạo ra một chính sách thu thập dữ liệu dạng văn bản thuần dành cho các user-agent tự động trên một host website. Công cụ này tạo các bản ghi User-agent, Allow, Disallow và Sitemap ngay trong trình duyệt của bạn và cho phép bạn kiểm tra một đường dẫn trước khi xuất bản.
Tạo và xác minh robots.txt trong năm bước
Tệp và trình kiểm tra được cập nhật ngay lập tức mà không cần tải lên quy tắc của bạn.
Dùng * cho tất cả các crawler tuân thủ, hoặc nhập đúng product token của một crawler cụ thể.
Dùng Disallow cho các đường dẫn rộng và chỉ dùng các ngoại lệ Allow cụ thể hơn ở nơi thực sự cần.
Thử các đường dẫn công khai, bị chặn và các đường dẫn ngoại lệ. Bản xem trước sẽ chỉ ra quy tắc thắng.
Tải robots.txt lên thư mục gốc của máy chủ, sau đó tải URL thật đang chạy và xác nhận phản hồi là bản hiện hành.
Cách hoạt động của việc khớp quy tắc
Trình kiểm tra tuân theo các hành vi khớp chính yếu do Robots Exclusion Protocol quy định.
Một đường dẫn khớp dài hơn có ưu tiên hơn một quy tắc ngắn hơn, rộng hơn.
Khi một quy tắc Allow và một quy tắc Disallow tương đương cùng khớp, nên áp dụng quy tắc Allow.
/Folder/ và /folder/ là hai đường dẫn khác nhau. Hãy kiểm tra đúng kiểu viết hoa/thường mà máy chủ của bạn dùng.
Danh sách kiểm tra tuân thủ RFC 9309
Đây là các yêu cầu của giao thức và quy tắc xử lý crawler, không phải lời đồn SEO tùy chọn.
§2.3Tệp và vị trí chính xácPhục vụ /robots.txt viết thường ở cấp cao nhất của mỗi scheme, máy chủ và cổng, dưới dạng text/plain mã hóa UTF-8.
§2.2.1–2.2.3Nhóm và khớpToken user-agent dùng chữ cái, dấu gạch ngang hoặc dấu gạch dưới. Việc so khớp có phân biệt chữ hoa chữ thường; quy tắc dài nhất thắng và Allow thắng khi hai bên bằng nhau.
§2.3.1Kết quả HTTP quan trọngCrawler nên đi theo ít nhất năm redirect. Tệp trả về 4xx có thể có nghĩa là được phép thu thập dữ liệu; lỗi 5xx hoặc sự cố mạng có nghĩa là cấm hoàn toàn trong thời gian không truy cập được.
§2.4–2.5Giới hạn cache và phân tíchMột tệp được lưu cache thường không nên được sử dụng quá 24 giờ, và các trình phân tích phải hỗ trợ ít nhất 500 KiB.
Bắt đầu từ một cơ sở CMS minh bạch
Chọn một nền tảng sẽ nạp một mẫu khởi đầu hiển thị rõ và có thể chỉnh sửa vào Generated robots.txt. Novaverb không bao giờ thêm chỉ thị ẩn; hãy xác minh phiên bản CMS đang cài đặt trước khi thay thế tệp do nền tảng quản lý.
/robots.txt, /wp-sitemap.xmlWordPress có thể phục vụ cả hai điểm cuối một cách ảo. Kiểm tra phản hồi hiện tại trước vì các plugin có thể thay thế đầu ra lõi; chỉ thêm các quy tắc mà bạn đã xác minh cho trang này.
Tham khảo lõi WordPressweb/robots.txtDrupal Composer Scaffold quản lý tệp gốc. Thêm hoặc vá các quy tắc cụ thể cho dự án thông qua cấu hình scaffold để các bản cập nhật lõi không xóa chúng một cách âm thầm.
Hướng dẫn khung Drupalrobots.txt.dist → robots.txtSử dụng tệp đơn giản được cung cấp với phiên bản Joomla chính xác của bạn làm nguồn nền tảng hiện tại. Không nhập danh sách đường dẫn từ một phiên bản cũ hơn hoặc một trang web khác.
Tệp lõi Joomlatemplates/robots.txt.liquidShopify đã cung cấp sẵn một tệp mặc định hướng SEO. Chỉ tùy chỉnh mẫu Liquid khi cần; thay thế toàn bộ tệp được tạo có thể loại bỏ các bản cập nhật nền tảng trong tương lai.
Hướng dẫn Shopifyapp/robots.tsSử dụng quy ước MetadataRoute.Robots cho đầu ra tĩnh hoặc động có kiểu, hoặc thêm app/robots.txt cho tệp tĩnh đơn giản.
Tham khảo robots Next.jspublic root or explicit /robots.txt routeCác framework này không hàm ý một bộ quy tắc SEO chung cho mọi trường hợp. Hãy phục vụ văn bản được tạo từ thư mục gốc công khai hoặc một route text/plain, rồi kiểm tra trên máy chủ production.
Chọn quyền truy cập AI theo mục đích
Khả năng hiển thị trên tìm kiếm, phát triển mô hình và truy xuất theo yêu cầu của người dùng là những quyết định khác nhau. Tên nhà cung cấp và chính sách có thể thay đổi, vì vậy hãy kiểm tra lại nguồn được liên kết trước khi xuất bản.
OAI-SearchBot, Claude-SearchBot, PerplexityBotViệc chặn chúng có thể làm giảm khả năng được phát hiện, đoạn trích, trích dẫn hoặc chất lượng kết quả tìm kiếm trong các sản phẩm AI tương ứng.
GPTBot, ClaudeBot, Google-ExtendedCác quyền kiểm soát có tên này liên quan đến khả năng huấn luyện mô hình, cải thiện mô hình hoặc grounding cho Gemini. Google-Extended không ảnh hưởng đến việc được đưa vào Google Search hay thứ hạng.
Một quy tắc user-agent không phải là xác minh danh tính, kiểm soát truy cập hay một cơ chế từ chối phổ quát. Hãy đọc tài liệu của nhà cung cấp và xác thực lưu lượng thực tế một cách riêng biệt.
Sử dụng điều khiển đúng cho công việc
robots.txt là một khai báo mong muốn về việc thu thập dữ liệu, không phải cơ chế kiểm soát truy cập và cũng không phải lệnh lập chỉ mục có đảm bảo.
Sử dụng tốt
- Giảm việc thu thập dữ liệu trên các bộ lọc trùng lặp, giỏ hàng và các đường dẫn tiện ích có giá trị thấp.
- Khai báo một hoặc nhiều URL sitemap tuyệt đối.
- Tạo quy tắc riêng cho các crawler tự khai báo danh tính và tuân thủ giao thức.
Không được đảm bảo bởi robots.txt
- Giữ nội dung nhạy cảm ở chế độ riêng tư - hãy dùng xác thực và phân quyền.
- Xóa một URL khỏi tìm kiếm - sử dụng phản hồi noindex có thể lập chỉ mục, quy trình xóa hoặc kiểm soát truy cập khi thích hợp.
- Buộc mọi crawler hoặc hệ thống AI phải tuân thủ - giao thức này chỉ mang tính khuyến nghị.
Đã tạo không giống như trực tiếp
Một bản nháp đúng vẫn có thể bị tải lên nhầm máy chủ, bị lưu cache, bị redirect hoặc được trả về kèm lỗi. Sau khi xuất bản, hãy tải tệp thật về, xác minh trạng thái HTTP của nó và xác nhận rằng các chỉ thị Sitemap phân giải được.
Trình tạo Robots.txt Câu hỏi thường gặp
robots.txt làm gì?
robots.txt cho các crawler tuân thủ biết chúng được phép yêu cầu những đường dẫn URL nào trên một giao thức, host và cổng cụ thể. Nó điều tiết việc thu thập dữ liệu; nó không phải là cơ chế xác thực và không đảm bảo rằng một URL đã được phát hiện sẽ nằm ngoài chỉ mục.
robots.txt nên được đặt ở đâu?
Hãy đặt tệp ở thư mục gốc của đúng máy chủ đó, ví dụ https://example.com/robots.txt. Một tệp nằm trong thư mục con không kiểm soát toàn bộ máy chủ, và các quy tắc không tự động chuyển giữa các tên miền phụ.
robots.txt có ngăn Google lập chỉ mục không?
Không. Một URL bị chặn vẫn có thể được phát hiện qua các liên kết và có thể xuất hiện mà không kèm đoạn trích. Hãy dùng chỉ thị noindex phù hợp khi bạn cần kiểm soát việc lập chỉ mục, và đừng chặn crawler đọc chỉ thị đó.
Google có hỗ trợ Crawl-delay không?
Không. Google nêu rõ User-agent, Allow, Disallow và Sitemap là các trường robots.txt được hỗ trợ và không hỗ trợ Crawl-delay, vì vậy trình tạo này cố ý không thêm trường đó.
Quy tắc nào thắng khi cả Cho phép và Không cho phép đều khớp?
Đường dẫn khớp cụ thể nhất sẽ thắng. Nếu một quy tắc Allow và một quy tắc Disallow tương đương nhau, Allow nên thắng. Việc khớp có phân biệt chữ hoa chữ thường.
Tôi có thể thêm sitemap vào robots.txt không?
Có. Thêm một hoặc nhiều URL sitemap HTTP hoặc HTTPS đầy đủ. Giá trị Sitemap phải là tuyệt đối, và nó có thể chỉ đến một máy chủ khác.
robots.txt có thể chặn các crawler AI không?
Bạn có thể nhắm đến một crawler tự nhận diện bằng product token, nhưng chỉ những crawler nhận biết và tôn trọng Robots Exclusion Protocol mới tuân thủ. Đừng coi tệp này là bảo đảm ngăn được việc truy cập, huấn luyện hoặc tái sử dụng.
Tôi nên cho phép hoặc chặn những trình thu thập dữ liệu AI nào?
Quyết định theo mục đích. OAI-SearchBot, Claude-SearchBot và PerplexityBot hỗ trợ việc được tìm thấy trong tìm kiếm hoặc việc trích dẫn; GPTBot, ClaudeBot và Google-Extended cung cấp các quyền kiểm soát riêng liên quan đến phát triển mô hình hoặc grounding cho Gemini. Chính sách thay đổi, vì vậy hãy xác minh tài liệu hiện hành của từng nhà cung cấp trước khi xuất bản.
Tôi có nên thay thế robots.txt mặc định trong WordPress, Drupal, Joomla hay Shopify không?
Thường thì không. Bắt đầu từ tệp hoặc đầu ra ảo được duy trì bởi phiên bản nền tảng đã cài đặt, sau đó chỉ thêm các thay đổi riêng của dự án đã được xác minh. Shopify khuyến nghị giữ nguyên các giá trị mặc định Liquid mà nền tảng tạo ra, trong khi Drupal Composer Scaffold có thể quản lý và cập nhật tệp gốc.
Dữ liệu của tôi có được tải lên đâu không?
Không. Trình tạo này chạy hoàn toàn ở phía client, ngay trong trình duyệt của bạn. Không có nội dung nào bạn nhập được gửi tới máy chủ, vì vậy có thể dùng an toàn cho nội dung riêng tư.
Nó có thực sự miễn phí không?
Có, không cần tài khoản. Bạn chỉ cần một không gian làm việc Novaverb khi muốn xác minh, giám sát và theo dõi các tệp này trên website đang chạy của bạn theo thời gian.