Öffentliches Crawlen standardmäßig erlauben, benutzerdefinierte Regeln hinzufügen oder das Crawlen für eine temporäre Umgebung ausdrücklich blockieren.
Free Robots.txt Generator for SEO & AI Crawlers
Create and test a plain RFC 9309-aligned robots.txt with CMS publishing guidance and optional AI crawler controls. Copy or download it free - no signup.
Wählen Sie eine Basisrichtlinie und fügen Sie nur die Pfade hinzu, die eine Ausnahme benötigen.
Verwenden Sie * für alle Crawler oder ein genaues Produkt-Token wie Googlebot.
Verwenden Sie * oder ein Produkt-Token, das nur Buchstaben, Bindestriche und Unterstriche enthält.
Geben Sie Pfade auf diesem Host ein. Ein fehlender führender Schrägstrich wird automatisch hinzugefügt.
Verwenden Sie einen spezifischeren Erlauben-Pfad innerhalb eines breiteren blockierten Bereichs.
Entfernen Sie Kommentare, Zeilenumbrüche oder Steuerzeichen aus Regelwerten.
Verwenden Sie vollständige http:// oder https:// URLs. Cross-Host-Sitemap-URLs sind erlaubt.
Jede Sitemap muss eine vollständige HTTP- oder HTTPS-URL sein.
Es werden keine benannten KI-Gruppen hinzugefügt. Alle Crawler fallen auf deine Hauptgruppe zurück.
Keine passende Einschränkung - Crawlen ist erlaubt.
Wandle Ausgabe in einen überwachten Workflow um
Ein Novaverb-Arbeitsbereich crawlt Ihre Live-Website, überprüft, ob diese Tags und Dateien tatsächlich bereitgestellt werden, verfolgt Änderungen im Laufe der Zeit und wandelt Erkenntnisse in zugewiesene Aufgaben um.
Robots.txt Generator
Was ist ein robots.txt-Generator?
Ein robots.txt-Generator erstellt eine einfache Crawling-Richtlinie für automatisierte Benutzeragenten auf einem Website-Host. Dieses Tool erstellt User-Agent-, Erlauben-, Verweigern- und Sitemap-Datensätze in Ihrem Browser und ermöglicht es Ihnen, einen Pfad vor der Veröffentlichung zu testen.
Erstellen und Überprüfen von robots.txt in fünf Schritten
Die Datei und der Tester werden sofort aktualisiert, ohne dass Sie Ihre Regeln hochladen müssen.
Verwenden Sie * für alle konformen Crawler oder geben Sie das genaue Produkt-Token für einen Crawler ein.
Verhindern Sie breite Pfade und verwenden Sie spezifischere Erlauben-Ausnahmen nur dort, wo nötig.
Testen Sie öffentliche, blockierte und Ausnahmepfade. Die Vorschau identifiziert die gewinnende Regel.
Laden Sie robots.txt in das Stammverzeichnis des Hosts hoch, holen Sie dann die Live-URL ab und bestätigen Sie, dass die Antwort aktuell ist.
Wie die Regelübereinstimmung funktioniert
Der Tester folgt dem Schlüsselverhalten zur Übereinstimmung, das im Robots Exclusion Protocol definiert ist.
Ein längerer übereinstimmender Pfad hat Vorrang vor einer kürzeren, allgemeineren Regel.
Wenn gleichwertige Erlauben- und Verweigern-Regeln übereinstimmen, sollte die Erlauben-Regel verwendet werden.
/Folder/ und /folder/ sind unterschiedliche Pfade. Teste die gleiche Groß- und Kleinschreibung, die dein Server verwendet.
RFC 9309-Konformitätscheckliste
Dies sind Protokollanforderungen und Regeln zur Handhabung von Crawlern, keine optionalen SEO-Mythen.
§2.3Korrekte Datei und StandortDiene eine kleingeschriebene /robots.txt auf der obersten Ebene jedes Schemas, Hosts und Ports als UTF-8 text/plain.
§2.2.1–2.2.3Gruppen und ÜbereinstimmungenUser-Agent-Tokens verwenden Buchstaben, Bindestriche oder Unterstriche. Die Übereinstimmung ist groß-/kleinschreibungssensitiv; die längste Regel gewinnt und Allow gewinnt bei einem Gleichstand.
§2.3.1HTTP-Ergebnisse sind wichtigCrawler sollten mindestens fünf Weiterleitungen folgen. Eine 4xx-Datei kann bedeuten, dass das Crawlen erlaubt ist; ein 5xx- oder Netzwerkfehler bedeutet vollständige Verweigerung, während unerreichbar.
§2.4–2.5Cache- und Parser-LimitsEine zwischengespeicherte Datei sollte normalerweise nicht länger als 24 Stunden verwendet werden, und Parser müssen mindestens 500 KiB unterstützen.
Starten Sie von einer transparenten CMS-Basislinie
Die Auswahl einer Plattform lädt einen sichtbaren, bearbeitbaren Starter in die generierte robots.txt. Novaverb fügt niemals versteckte Anweisungen hinzu; überprüfen Sie die installierte CMS-Version, bevor Sie eine plattformverwaltete Datei ersetzen.
/robots.txt · /wp-sitemap.xmlWordPress kann beide Endpunkte virtuell bedienen. Überprüfe zuerst die aktuelle Antwort, da Plugins die Kern-Ausgabe ersetzen können; füge nur Regeln hinzu, die du für diese Seite verifiziert hast.
WordPress-Kernreferenzweb/robots.txtDrupal Composer Scaffold verwaltet die Stammdatei. Fügen Sie projektbezogene Regeln über die Scaffold-Konfiguration hinzu oder patchen Sie sie, damit Kernupdates sie nicht stillschweigend löschen.
Drupal-Scaffold-Leitfadenrobots.txt.dist → robots.txtVerwende die einfache Datei, die mit deiner genauen Joomla-Version geliefert wird, als aktuelle Plattformquelle. Importiere keine Pfadliste aus einer älteren Version oder einer anderen Website.
Joomla-Kerndateitemplates/robots.txt.liquidShopify bietet bereits ein SEO-orientiertes Standardangebot. Passe die Liquid-Vorlage nur bei Bedarf an; das Ersetzen der gesamten generierten Datei kann zukünftige Plattformupdates entfernen.
Shopify-Anleitungapp/robots.tsVerwende die MetadataRoute.Robots-Konvention für typisierte statische oder dynamische Ausgaben oder füge app/robots.txt für eine einfache statische Datei hinzu.
Next.js-Roboterreferenzpublic root or explicit /robots.txt routeDiese Frameworks implizieren keinen universellen SEO-Regelsatz. Diene den generierten Text aus dem öffentlichen Stammverzeichnis oder einer text/plain-Route und teste den Produktionshost.
Wählen Sie den KI-Zugriff nach Zweck
Suchsichtbarkeit, Modellentwicklung und benutzerangeforderte Abrufe sind unterschiedliche Entscheidungen. Anbieternamen und Richtlinien können sich ändern, also überprüfe die verlinkte Quelle vor der Veröffentlichung.
OAI-SearchBot, Claude-SearchBot, PerplexityBotDas Blockieren dieser kann die Entdeckung, Snippets, Zitationen oder die Qualität der Suchergebnisse in den entsprechenden KI-Produkten verringern.
GPTBot, ClaudeBot, Google-ExtendedDiese benannten Kontrollen beziehen sich auf potenzielles Modelltraining, Modellverbesserung oder Gemini-Grundlagen. Google-Extended hat keinen Einfluss auf die Aufnahme oder das Ranking in Google Search.
Eine User-Agent-Regel ist keine Identitätsüberprüfung, Zugriffskontrolle oder ein universelles Opt-out. Überprüfen Sie die Dokumentation des Anbieters und validieren Sie den echten Verkehr separat.
Verwenden Sie die richtige Steuerung für die Aufgabe
robots.txt ist eine Crawl-Präferenz, keine Zugriffskontrolle oder ein garantierter Indexierungsbefehl.
Gute Verwendungen
- Reduzieren Sie das Crawlen von doppelten Filtern, Warenkörben und wenig wertvollen Dienstleistungs-Pfaden.
- Einen oder mehrere absolute Sitemap-URLs offenlegen.
- Erstellen Sie spezifische Regeln für Crawler, die sich identifizieren und das Protokoll respektieren.
Nicht durch robots.txt garantiert
- Halten Sie sensible Inhalte privat - verwenden Sie Authentifizierung und Autorisierung.
- Entfernen einer URL aus der Suche - verwenden Sie eine indexierbare noindex-Antwort, einen Entfernungsworkflow oder Zugangskontrolle, wie angemessen.
- Jeden Crawler oder KI-System zur Einhaltung zwingen - das Protokoll ist beratend.
Generiert ist nicht dasselbe wie live
Ein korrekter Entwurf kann dennoch auf den falschen Host hochgeladen, zwischengespeichert, umgeleitet oder mit einem Fehler bereitgestellt werden. Überprüfe nach der Veröffentlichung die echte Datei, verifiziere ihren HTTP-Status und bestätige, dass die Sitemap-Direktiven aufgelöst werden.
Robots.txt Generator FAQ
Was macht robots.txt?
robots.txt sagt konformen Crawlern, welche URL-Pfade sie auf einem bestimmten Schema, Host und Port anfordern dürfen. Es verwaltet das Crawlen; es ist keine Authentifizierung und garantiert nicht, dass eine entdeckte URL aus einem Index ausgeschlossen bleibt.
Wo sollte robots.txt platziert werden?
Platzieren Sie es im Stamm des genauen Hosts, z. B. https://example.com/robots.txt. Eine Datei in einem Unterordner steuert nicht den gesamten Host, und Regeln werden nicht automatisch zwischen Subdomains übertragen.
Verhindert robots.txt die Indizierung durch Google?
Nein. Eine blockierte URL kann weiterhin über Links entdeckt werden und kann ohne Snippet erscheinen. Verwenden Sie eine geeignete noindex-Direktive, wenn Sie die Indizierungskontrolle benötigen, und blockieren Sie den Crawler nicht daran, diese Direktive zu lesen.
Unterstützt Google Crawl-delay?
Nein. Google dokumentiert User-agent, Allow, Disallow und Sitemap als unterstützte robots.txt-Felder und unterstützt kein Crawl-delay, daher fügt dieser Generator es absichtlich nicht hinzu.
Welche Regel gewinnt, wenn Erlauben und Verweigern übereinstimmen?
Der spezifischste übereinstimmende Pfad gewinnt. Wenn eine Erlauben- und eine Verweigern-Regel gleichwertig sind, sollte Erlauben gewinnen. Die Übereinstimmung ist groß-/kleinschreibungssensitiv.
Kann ich eine Sitemap zu robots.txt hinzufügen?
Ja. Fügen Sie eine oder mehrere vollständige HTTP- oder HTTPS-Sitemap-URLs hinzu. Der Sitemap-Wert muss absolut sein und kann auf einen anderen Host verweisen.
Kann robots.txt KI-Crawler blockieren?
Sie können einen Crawler anvisieren, der sich mit einem Produkt-Token identifiziert, aber nur Crawler, die das Robots Exclusion Protocol erkennen und respektieren, werden sich daran halten. Behandeln Sie die Datei nicht als Garantie gegen Zugriff, Schulung oder Wiederverwendung.
Welche KI-Crawler sollte ich erlauben oder blockieren?
Entscheiden Sie nach Zweck. OAI-SearchBot, Claude-SearchBot und PerplexityBot unterstützen die Entdeckung oder Zitation von Suchanfragen; GPTBot, ClaudeBot und Google-Extended bieten separate Kontrollen in Bezug auf die Modellentwicklung oder Gemini-Grundlage. Richtlinien ändern sich, also überprüfen Sie die aktuelle Dokumentation jedes Anbieters vor der Veröffentlichung.
Sollte ich die Standard-robots.txt in WordPress, Drupal, Joomla oder Shopify ersetzen?
In der Regel nein. Beginne mit der Datei oder virtuellen Ausgabe, die von der installierten Plattformversion verwaltet wird, und füge dann nur verifizierte projektspezifische Änderungen hinzu. Shopify empfiehlt, die generierten Liquid-Standards zu bewahren, während Drupal Composer Scaffold die Stammdatei verwalten und aktualisieren kann.
Wurde meine Daten irgendwo hochgeladen?
Nein. Dieser Generator läuft vollständig clientseitig in Ihrem Browser. Nichts, was Sie eingeben, wird an einen Server gesendet, daher ist es sicher, ihn für private Inhalte zu verwenden.
Ist es wirklich kostenlos?
Ja, ohne Konto. Ein Novaverb-Arbeitsbereich ist nur erforderlich, wenn Sie diese Dateien über die Zeit auf Ihrer Live-Website verifizieren, überwachen und verfolgen möchten.