Gerador de robots.txt e sitemap

Informe o agente, os caminhos permitidos e bloqueados e as URLs de sitemaps. Adicione as URLs das páginas para gerar o mapa XML.

Funciona localmente no seu navegador
Esta ferramenta processa todos os dados localmente no seu navegador.
EntradaUse um caminho ou URL por linha. O gerador valida a sintaxe localmente e não consulta nenhum site.

Como gerar robots.txt e sitemap.xml

Preencha os cinco campos e pressione Gerar arquivos: o robots.txt é escrito a partir das linhas de agente, Disallow, Allow e Sitemap, e o sitemap.xml a partir da lista de URLs. Os dois são produzidos neste navegador; nenhum site é consultado e nada é enviado.

No sitemap só entram endereços absolutos http e https. Todo o resto fica fora do arquivo e é listado sob os campos, para que nenhuma entrada malformada chegue ao seu site.

  1. Informe o nome do rastreador em Agente, ou mantenha o padrão * para todos. Vários nomes podem ser separados por vírgulas ou escritos em linhas próprias; cada um vira uma linha User-agent.
  2. Liste os caminhos bloqueados em Disallow e as exceções em Allow, um por linha. Um caminho sem barra inicial, ou uma URL completa, é reescrito como caminho e isso é informado.
  3. Adicione o endereço de cada sitemap publicado em URLs de sitemap e cole os endereços de página para o sitemap.xml no último campo, um por linha.
  4. Pressione Gerar arquivos. Os dois painéis são preenchidos ao mesmo tempo, junto com a contagem das linhas alteradas, ignoradas ou repetidas.
  5. Copie ou baixe cada arquivo e publique na raiz do site: /robots.txt e /sitemap.xml.

O que os arquivos fazem, o que o gerador altera e quais são os limites

O que os dois arquivos fazem

O robots.txt diz aos rastreadores quais caminhos eles podem requisitar. É um pedido, não uma barreira de segurança: um rastreador que o ignore ainda acessa a página, então o que precisa ser privado deve ficar atrás de autenticação. Cada regra pertence ao grupo de agente acima dela, e é por isso que o arquivo gerado começa com User-agent e depois lista os caminhos.

O sitemap.xml lista os endereços que você quer indexados. Ele ajuda na descoberta, não no ranqueamento, e uma URL bloqueada no robots.txt não será indexada mesmo aparecendo no sitemap.

O que o gerador altera na sua entrada

Os caminhos são corrigidos para o arquivo continuar válido: a barra inicial que falta é adicionada, uma URL completa colada vira seu caminho e sua query, e uma linha que mesmo assim não pode ser um caminho fica fora do arquivo e é nomeada no status. Linhas que começam com # são mantidas como comentários, o que o robots.txt permite. Linhas de URL e de Sitemap repetidas são escritas uma única vez e reportadas como duplicadas. Curingas (*) e a âncora final ($) passam intactos.

O que esta página não faz

Não há Crawl-delay, nem grupo separado por rastreador, nem lastmod, changefreq ou priority no sitemap. Um único arquivo de sitemap comporta no máximo 50.000 URLs, e a página avisa em vez de escrever mais. Nada é consultado, então um endereço que não existe mais é escrito exatamente como digitado; a página não pode saber se uma URL responde 200, redireciona ou devolve 404.

Ferramentas recentes: