Generator für robots.txt und Sitemap

Geben Sie User-Agent, erlaubte und gesperrte Pfade sowie Sitemap-URLs ein. Tragen Sie die Seiten-URLs für die XML-Sitemap selbst ein.

Läuft lokal in deinem Browser
Dieses Werkzeug verarbeitet alle Daten lokal in deinem Browser.
EingabeVerwenden Sie einen Pfad oder eine URL je Zeile. Der Generator prüft die Syntax lokal und ruft keine Website ab.

robots.txt und sitemap.xml erzeugen

Füllen Sie die fünf Felder und drücken Sie Dateien erzeugen: robots.txt entsteht aus den Zeilen für User-Agent, Disallow, Allow und Sitemap, sitemap.xml aus der URL-Liste. Beides wird in diesem Browser erzeugt; keine Website wird abgerufen und nichts hochgeladen.

In das Sitemap gelangen nur absolute http- und https-Adressen. Alles andere bleibt außerhalb der Datei und wird unter den Feldern aufgelistet, damit kein fehlerhafter Eintrag auf Ihrer Website landet.

  1. Tragen Sie den Crawler-Namen unter User-Agent ein oder lassen Sie die Vorgabe * für alle. Mehrere Namen können durch Kommas oder eigene Zeilen getrennt werden; jeder wird zu einer eigenen User-agent-Zeile.
  2. Listen Sie blockierte Pfade unter Disallow und Ausnahmen unter Allow auf, einen pro Zeile. Ein Pfad ohne führenden Schrägstrich oder eine vollständige URL wird in einen Pfad umgeschrieben und gemeldet.
  3. Tragen Sie die Adresse jedes veröffentlichten Sitemaps unter Sitemap-URLs ein und fügen Sie die Seitenadressen für sitemap.xml im letzten Feld ein, eine pro Zeile.
  4. Drücken Sie Dateien erzeugen. Beide Bereiche füllen sich gleichzeitig, zusammen mit der Anzahl der geänderten, übersprungenen oder doppelten Zeilen.
  5. Kopieren oder laden Sie jede Datei herunter und veröffentlichen Sie sie im Wurzelverzeichnis: /robots.txt und /sitemap.xml.

Was die Dateien tun, was der Generator ändert und wo die Grenzen liegen

Was die beiden Dateien tun

robots.txt sagt Crawlern, welche Pfade sie anfordern dürfen. Das ist eine Bitte, keine Sicherheitsgrenze: Ein Crawler, der sie ignoriert, ruft die Seite weiterhin ab; wirklich Privates gehört hinter eine Anmeldung. Eine Regel gehört zur User-Agent-Gruppe darüber, deshalb beginnt die erzeugte Datei mit User-agent und listet danach die Pfade.

sitemap.xml listet die Adressen, die indexiert werden sollen. Sie hilft beim Finden, nicht beim Ranking, und eine in robots.txt gesperrte URL wird nicht indexiert, auch wenn sie zusätzlich im Sitemap steht.

Was der Generator an Ihrer Eingabe ändert

Pfade werden korrigiert, damit die Datei gültig bleibt: ein fehlender führender Schrägstrich wird ergänzt, eine eingefügte vollständige URL wird zu Pfad und Query, und eine Zeile, die trotzdem kein Pfad sein kann, bleibt aus der Datei heraus und wird im Status genannt. Zeilen mit # bleiben als Kommentar erhalten, was robots.txt erlaubt. Doppelte URL- und Sitemap-Zeilen werden einmal geschrieben und als Duplikat gemeldet. Platzhalter (*) und das Endanker-Zeichen ($) bleiben unverändert.

Was diese Seite nicht macht

Es gibt kein Crawl-delay, keine getrennte Gruppe je Crawler und im Sitemap kein lastmod, changefreq oder priority. Eine einzelne Sitemap-Datei fasst höchstens 50.000 URLs, und die Seite sagt das, statt mehr zu schreiben. Nichts wird abgerufen, eine nicht mehr existierende Adresse steht also genau so in der Datei; die Seite kann nicht wissen, ob eine URL 200 liefert, umleitet oder 404 ergibt.

Zuletzt verwendet: