Informe o agente, os caminhos permitidos e bloqueados e as URLs de sitemaps. Adicione as URLs das páginas para gerar o mapa XML.
Funciona localmente no seu navegadorPreencha os cinco campos e pressione Gerar arquivos: o robots.txt é escrito a partir das linhas de agente, Disallow, Allow e Sitemap, e o sitemap.xml a partir da lista de URLs. Os dois são produzidos neste navegador; nenhum site é consultado e nada é enviado.
No sitemap só entram endereços absolutos http e https. Todo o resto fica fora do arquivo e é listado sob os campos, para que nenhuma entrada malformada chegue ao seu site.
O robots.txt diz aos rastreadores quais caminhos eles podem requisitar. É um pedido, não uma barreira de segurança: um rastreador que o ignore ainda acessa a página, então o que precisa ser privado deve ficar atrás de autenticação. Cada regra pertence ao grupo de agente acima dela, e é por isso que o arquivo gerado começa com User-agent e depois lista os caminhos.
O sitemap.xml lista os endereços que você quer indexados. Ele ajuda na descoberta, não no ranqueamento, e uma URL bloqueada no robots.txt não será indexada mesmo aparecendo no sitemap.
Os caminhos são corrigidos para o arquivo continuar válido: a barra inicial que falta é adicionada, uma URL completa colada vira seu caminho e sua query, e uma linha que mesmo assim não pode ser um caminho fica fora do arquivo e é nomeada no status. Linhas que começam com # são mantidas como comentários, o que o robots.txt permite. Linhas de URL e de Sitemap repetidas são escritas uma única vez e reportadas como duplicadas. Curingas (*) e a âncora final ($) passam intactos.
Não há Crawl-delay, nem grupo separado por rastreador, nem lastmod, changefreq ou priority no sitemap. Um único arquivo de sitemap comporta no máximo 50.000 URLs, e a página avisa em vez de escrever mais. Nada é consultado, então um endereço que não existe mais é escrito exatamente como digitado; a página não pode saber se uma URL responde 200, redireciona ou devolve 404.