Autoriser le crawl public par défaut, ajouter des règles personnalisées ou bloquer explicitement le crawl pour un environnement temporaire.
Free Robots.txt Generator for SEO & AI Crawlers
Create and test a plain RFC 9309-aligned robots.txt with CMS publishing guidance and optional AI crawler controls. Copy or download it free - no signup.
Choisissez une politique de base, puis ajoutez uniquement les chemins nécessitant une exception.
Utilisez * pour tous les robots ou un jeton de produit exact tel que Googlebot.
Utilisez * ou un jeton de produit contenant uniquement des lettres, des tirets et des underscores.
Entrez des chemins sur cet hôte. Un slash initial manquant est ajouté automatiquement.
Utilisez un chemin Autoriser plus spécifique à l'intérieur d'une zone bloquée plus large.
Supprimer les commentaires, les sauts de ligne ou les caractères de contrôle des valeurs de règle.
Utilisez des URL http:// ou https:// complètes. Les URL de sitemap inter-hôtes sont autorisées.
Chaque sitemap doit être une URL HTTP ou HTTPS complète.
Aucun groupe AI nommé ne sera ajouté. Tous les robots reviennent à votre groupe principal.
Aucune restriction correspondante - le crawl est autorisé.
Transformez la sortie en un flux de travail surveillé
Un espace de travail Novaverb explore votre site en direct, vérifie que ces balises et fichiers sont effectivement servis, suit les changements dans le temps et transforme les résultats en tâches assignées.
Robots.txt Generator
Qu'est-ce qu'un générateur de robots.txt ?
Un générateur de robots.txt crée une politique de crawl en texte brut pour les agents utilisateurs automatisés sur un hôte de site web. Cet outil crée des enregistrements User-agent, Autoriser, Interdire et Sitemap dans votre navigateur et vous permet de tester un chemin avant de le publier.
Créer et vérifier robots.txt en cinq étapes
Le fichier et le testeur se mettent à jour instantanément sans télécharger vos règles.
Utilisez * pour tous les robots conformes ou entrez le jeton de produit exact pour un robot.
Interdire des chemins larges et utiliser des exceptions d'autorisation plus spécifiques uniquement si nécessaire.
Essayez des chemins publics, bloqués et d'exception. L'aperçu identifie la règle gagnante.
Téléchargez robots.txt à la racine de l'hôte, puis récupérez l'URL en direct et confirmez que la réponse est actuelle.
Comment fonctionne la correspondance des règles
Le testeur suit le comportement de correspondance clé défini par le Protocole d'Exclusion des Robots.
Un chemin correspondant plus long prend le pas sur une règle plus courte et plus large.
Lorsque des règles Autoriser et Interdire équivalentes correspondent toutes deux, la règle Autoriser doit être utilisée.
/Folder/ et /folder/ sont des chemins différents. Testez la même casse que celle utilisée par votre serveur.
Liste de contrôle de conformité RFC 9309
Ce sont des exigences de protocole et des règles de gestion des robots, pas du folklore SEO optionnel.
§2.3Fichier et emplacement correctsServez /robots.txt en minuscules au niveau supérieur de chaque schéma, hôte et port en tant que texte/plain UTF-8.
§2.2.1–2.2.3Groupes et correspondanceLes jetons User-agent utilisent des lettres, des tirets ou des underscores. La correspondance est sensible à la casse ; la règle la plus longue l'emporte et Allow l'emporte en cas d'égalité.
§2.3.1Les résultats HTTP comptentLes robots doivent suivre au moins cinq redirections. Un fichier 4xx peut signifier que le crawl est autorisé ; un échec 5xx ou réseau signifie un refus complet tant qu'il est injoignable.
§2.4–2.5Limites de cache et d'analyseurUn fichier mis en cache ne doit normalement pas être utilisé au-delà de 24 heures, et les analyseurs doivent prendre en charge au moins 500 Ko.
Commencez à partir d'une base CMS transparente
Sélectionner une plateforme charge un starter visible et modifiable dans le robots.txt généré. Novaverb n'ajoute jamais de directives cachées ; vérifiez la version CMS installée avant de remplacer un fichier géré par la plateforme.
/robots.txt · /wp-sitemap.xmlWordPress peut servir les deux points de terminaison virtuellement. Inspectez d'abord la réponse actuelle car les plugins peuvent remplacer la sortie principale ; ajoutez uniquement des règles que vous avez vérifiées pour ce site.
Référence du cœur de WordPressweb/robots.txtDrupal Composer Scaffold gère le fichier racine. Ajoutez ou modifiez des règles spécifiques au projet via la configuration de l'échafaudage afin que les mises à jour du cœur ne les effacent pas silencieusement.
Guide de l'échafaudage Drupalrobots.txt.dist → robots.txtUtilisez le fichier simple expédié avec votre version Joomla exacte comme source de plateforme actuelle. N'importez pas une liste de chemins d'une version antérieure ou d'un autre site web.
Fichier de base Joomlatemplates/robots.txt.liquidShopify sert déjà un défaut orienté SEO. Personnalisez le modèle Liquid uniquement si nécessaire ; remplacer le fichier généré complet peut supprimer les mises à jour futures de la plateforme.
Conseils Shopifyapp/robots.tsUtilisez la convention MetadataRoute.Robots pour une sortie statique ou dynamique typée, ou ajoutez app/robots.txt pour un fichier statique simple.
Référence des robots Next.jspublic root or explicit /robots.txt routeCes frameworks n'impliquent pas un ensemble de règles SEO universel. Servez le texte généré depuis la racine publique ou un itinéraire texte/plain et testez l'hôte de production.
Choisissez l'accès AI par objectif
La visibilité de recherche, le développement de modèle et la récupération demandée par l'utilisateur sont des décisions différentes. Les noms et politiques des fournisseurs peuvent changer, donc vérifiez la source liée avant de publier.
OAI-SearchBot, Claude-SearchBot, PerplexityBotBloquer ceux-ci peut réduire la découverte, les extraits, les citations ou la qualité des résultats de recherche dans les produits AI correspondants.
GPTBot, ClaudeBot, Google-ExtendedCes contrôles nommés concernent la formation potentielle de modèle, l'amélioration de modèle ou le grounding Gemini. Google-Extended n'affecte pas l'inclusion ou le classement dans Google Search.
Une règle d'agent utilisateur n'est pas une vérification d'identité, un contrôle d'accès ou un opt-out universel. Consultez la documentation du fournisseur et validez le trafic réel séparément.
Utilisez le bon contrôle pour le travail
robots.txt est une préférence de crawl, pas un contrôle d'accès ou un ordre d'indexation garanti.
Bonnes utilisations
- Réduire le crawling des filtres en double, des paniers et des chemins utilitaires de faible valeur.
- Exposez une ou plusieurs URL de sitemap absolues.
- Créer des règles spécifiques pour les crawlers qui s'identifient et respectent le protocole.
Pas garanti par robots.txt
- Gardez le contenu sensible privé - utilisez l'authentification et l'autorisation.
- Suppression d'une URL de la recherche - utilisez une réponse noindex indexable, un flux de suppression ou un contrôle d'accès selon le cas.
- Forcer chaque crawler ou système AI à se conformer - le protocole est consultatif.
Généré n'est pas la même chose que en direct
Un brouillon correct peut toujours être téléchargé sur le mauvais hôte, mis en cache, redirigé ou servi avec une erreur. Après publication, récupérez le vrai fichier, vérifiez son statut HTTP et confirmez que les directives Sitemap se résolvent.
Robots.txt Generator FAQ
Que fait robots.txt ?
robots.txt indique aux robots conformes quels chemins d'URL ils peuvent demander sur un schéma, un hôte et un port spécifiques. Il gère le crawl ; ce n'est pas une authentification et ne garantit pas qu'une URL découverte restera hors d'un index.
Où robots.txt doit-il être placé ?
Placez-le à la racine de l'hôte exact, par exemple https://example.com/robots.txt. Un fichier dans un sous-dossier ne contrôle pas l'ensemble de l'hôte, et les règles ne se transfèrent pas automatiquement entre les sous-domaines.
Le robots.txt empêche-t-il l'indexation par Google ?
Non. Une URL bloquée peut toujours être découverte à partir de liens et peut apparaître sans extrait. Utilisez une directive noindex appropriée lorsque vous avez besoin de contrôle d'indexation, et ne bloquez pas le crawler de lire cette directive.
Google supporte-t-il Crawl-delay ?
Non. Google documente User-agent, Allow, Disallow et Sitemap comme des champs robots.txt pris en charge et ne supporte pas Crawl-delay, donc ce générateur ne l'ajoute pas intentionnellement.
Quelle règle l'emporte lorsque Autoriser et Interdire correspondent tous deux ?
Le chemin de correspondance le plus spécifique l'emporte. Si une règle Autoriser et une règle Interdire sont équivalentes, Autoriser doit l'emporter. La correspondance est sensible à la casse.
Puis-je ajouter un sitemap à robots.txt ?
Oui. Ajoutez une ou plusieurs URL de sitemap HTTP ou HTTPS complètes. La valeur Sitemap doit être absolue et peut pointer vers un hôte différent.
Le robots.txt peut-il bloquer les crawlers AI ?
Vous pouvez cibler un robot qui s'identifie avec un jeton de produit, mais seuls les robots qui reconnaissent et respectent le Protocole d'Exclusion des Robots se conformeront. Ne considérez pas le fichier comme une garantie contre l'accès, la formation ou la réutilisation.
Quels robots AI devrais-je autoriser ou bloquer ?
Décidez par objectif. OAI-SearchBot, Claude-SearchBot et PerplexityBot soutiennent la découverte de recherche ou les citations ; GPTBot, ClaudeBot et Google-Extended fournissent des contrôles séparés liés au développement de modèles ou à la base de Gemini. Les politiques changent, donc vérifiez la documentation actuelle de chaque fournisseur avant de publier.
Dois-je remplacer le robots.txt par défaut dans WordPress, Drupal, Joomla ou Shopify ?
En général, non. Commencez par le fichier ou la sortie virtuelle maintenue par la version de plateforme installée, puis ajoutez uniquement des modifications spécifiques au projet vérifiées. Shopify recommande de préserver ses défauts Liquid générés, tandis que Drupal Composer Scaffold peut gérer et mettre à jour le fichier racine.
Mes données sont-elles téléchargées quelque part ?
Non. Ce générateur fonctionne entièrement côté client dans votre navigateur. Rien de ce que vous tapez n'est envoyé à un serveur, donc il est sûr à utiliser sur du contenu privé.
Est-ce vraiment gratuit ?
Oui, sans compte. Un espace de travail Novaverb n'est nécessaire que lorsque vous souhaitez vérifier, surveiller et suivre ces fichiers sur votre site en direct au fil du temps.