Generador de robots.txt y sitemap

Indica el agente, las rutas permitidas y bloqueadas y las URL de sitemaps. Añade las URL de las páginas para generar el mapa XML.

Se ejecuta localmente en tu navegador
Esta herramienta procesa todos los datos localmente en tu navegador.
EntradaUsa una ruta o URL por línea. El generador valida la sintaxis localmente; no consulta ningún sitio.

Cómo generar robots.txt y sitemap.xml

Rellena los cinco campos y pulsa Generar archivos: robots.txt se escribe a partir de las líneas de agente, Disallow, Allow y Sitemap, y sitemap.xml a partir de la lista de URL. Ambos se producen en este navegador; no se consulta ningún sitio ni se sube nada.

En el sitemap solo se escriben direcciones absolutas http y https. El resto de valores queda fuera del archivo y se lista bajo los campos, de modo que ninguna entrada mal formada llega a tu sitio.

  1. Escribe el nombre del rastreador en Agente, o deja el valor predeterminado * para todos. Puedes separar varios nombres con comas o ponerlos en líneas distintas; cada uno genera su propia línea User-agent.
  2. Enumera las rutas bloqueadas en Disallow y las excepciones en Allow, una por línea. Una ruta sin barra inicial, o una URL completa, se reescribe como ruta y se avisa de ello.
  3. Añade la dirección de cada sitemap que publiques en URL de sitemap y pega las direcciones de página para sitemap.xml en el último campo, una por línea.
  4. Pulsa Generar archivos. Los paneles de robots.txt y sitemap.xml se rellenan a la vez, junto con el recuento de las líneas cambiadas, omitidas o repetidas.
  5. Copia o descarga cada archivo y publícalo en la raíz del sitio: /robots.txt y /sitemap.xml.

Qué hacen los archivos, qué cambia el generador y cuáles son sus límites

Qué hacen los dos archivos

robots.txt indica a los rastreadores qué rutas pueden solicitar. Es una petición, no una barrera de seguridad: un rastreador que lo ignore puede seguir accediendo a la página, así que lo que deba ser privado va detrás de autenticación. Cada regla pertenece al grupo de agente que tiene encima, y por eso el archivo generado empieza por User-agent y después enumera las rutas.

sitemap.xml enumera las direcciones que quieres indexar. Ayuda al descubrimiento, no al posicionamiento, y una URL bloqueada en robots.txt no se indexará aunque también aparezca en el sitemap.

Qué cambia el generador en tu entrada

Las rutas se corrigen para que el archivo siga siendo válido: se añade la barra inicial que falte, una URL completa pegada se convierte en su ruta y su consulta, y una línea que aun así no puede ser una ruta se queda fuera del archivo y se nombra en el estado. Las líneas que empiezan por # se conservan como comentarios, algo que robots.txt permite. Las líneas de URL y de Sitemap repetidas se escriben una sola vez y se informan como duplicadas. Los comodines (*) y el ancla final ($) pasan intactos.

Lo que esta página no hace

No hay Crawl-delay, ni un grupo distinto por rastreador, ni lastmod, changefreq o priority en el sitemap. Un solo archivo de sitemap admite como máximo 50.000 URL, y la página lo dice en lugar de escribir más. No se consulta nada, así que una dirección que ya no existe se escribe tal cual: la página no puede saber si una URL responde 200, redirige o devuelve 404.

Herramientas recientes: