Rudra Analyzer

SEO

robots.txt e sitemap.xml explicados, com exemplos

Dois arquivos pequenos na raiz do seu site dizem aos rastreadores aonde eles podem ir e quais páginas você quer que sejam encontradas. Veja como cada um funciona, com exemplos.

Por Rudra Techno Team 8 min de leitura
Nesta página

Dois arquivos simples na raiz do seu site ajudam os mecanismos de busca a trabalhar com ele. O robots.txt diz aos rastreadores quais partes do site eles podem ou não rastrear. O sitemap.xml lista as páginas que você quer que eles encontrem. Os dois funcionam bem juntos, mas nenhum garante que uma página seja indexada ou fique fora dos resultados de busca, e não entender isso está por trás da maioria dos problemas descritos abaixo.

O que o robots.txt faz

O robots.txt é um arquivo de texto simples que precisa ficar na raiz de um host, por exemplo https://example.com/robots.txt. Ele vale somente para aquele protocolo e aquele host exatos, de modo que shop.example.com precisa do seu próprio arquivo. Os rastreadores que seguem o Protocolo de Exclusão de Robôs, entre eles o Googlebot e o Bingbot, leem o arquivo antes de rastrear e obedecem às regras.

É um conjunto de pedidos, não um recurso de segurança. Bots mal-comportados podem ignorá-lo, e o próprio arquivo é público, então listar nele uma pasta "secreta" na verdade anuncia essa pasta. Proteja o conteúdo privado com autenticação.

Um robots.txt simples

  • User-agent: *
  • Disallow: /admin/
  • Disallow: /cart
  • Disallow: /search
  • Sitemap: https://example.com/sitemap.xml

Linha por linha: as regras valem para todos os rastreadores (*); não rastreie nada dentro de /admin/ nem qualquer URL que comece com /cart ou /search; e o sitemap está no endereço indicado. A linha Sitemap precisa trazer uma URL completa e vale independentemente do grupo de user-agent em que estiver.

Como as regras são lidas

  • As regras são comparadas com o início do caminho da URL e diferenciam maiúsculas de minúsculas: Disallow: /Admin não bloqueia /admin.
  • O Google aceita dois curingas: * para qualquer sequência de caracteres e $ para o fim da URL. Disallow: /*.pdf$ bloqueia as URLs que terminam em .pdf.
  • Quando regras Allow e Disallow entram em conflito, o Google segue a regra correspondente mais específica (a mais longa), e Allow vence em caso de empate.
  • Um rastreador obedece apenas ao grupo mais específico que o nomeia. Se você tiver um grupo User-agent: Googlebot, o Googlebot ignora por completo o grupo User-agent: *, portanto repita as regras em comum.
  • Disallow: / bloqueia o site inteiro. Um Disallow: vazio não bloqueia nada.

Bloquear o rastreamento não é bloquear a indexação

Este é o ponto mais importante sobre o robots.txt. Uma URL bloqueada ainda pode aparecer nos resultados de busca, em geral sem descrição, se outras páginas apontarem para ela: o Google sabe que a URL existe, mas não a leu. Para manter uma página fora dos resultados, deixe que ela seja rastreada e adicione uma diretiva noindex, seja <meta name="robots" content="noindex"> no HTML, seja um cabeçalho de resposta X-Robots-Tag: noindex. Se o robots.txt bloquear a página, o Google nunca vai ver o noindex.

Regras que o Google ignora

O Google não aceita noindex dentro do robots.txt (deixou de respeitar essa regra não oficial em 2019) e ignora Crawl-delay. Já o Bing respeita Crawl-delay. Se o Googlebot estiver sobrecarregando o seu servidor, resolva a capacidade do servidor ou, em uma emergência, retorne temporariamente respostas 503 ou 429.

O que o sitemap.xml faz

Um sitemap XML é uma lista das URLs que você gostaria que os mecanismos de busca rastreassem e indexassem. Ele faz mais diferença em sites grandes, em sites novos com poucos links vindos de fora e em páginas difíceis de alcançar pelos links internos. Um sitemap mínimo tem esta cara:

  • <?xml version="1.0" encoding="UTF-8"?>
  • <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  • <url><loc>https://example.com/</loc><lastmod>2026-09-20</lastmod></url>
  • <url><loc>https://example.com/pricing</loc><lastmod>2026-08-02</lastmod></url>
  • </urlset>
  • Limites de tamanho: cada arquivo de sitemap comporta até 50.000 URLs e pode ter até 50 MB sem compressão. Sites maiores dividem as URLs em vários sitemaps e os listam em um arquivo de índice de sitemaps.
  • lastmod: o Google usa a data da última modificação se ela for consistentemente precisa. Atualize-a quando o conteúdo da página mudar de forma relevante, não a cada deploy.
  • priority e changefreq: o Google ignora os dois, então não há por que ajustá-los.
  • Liste apenas as URLs que você quer indexadas: páginas canônicas e indexáveis que retornam 200. Deixe de fora redirecionamentos, páginas de erro, páginas com noindex e URLs duplicadas com parâmetros de rastreamento de campanha.

Como criar e enviar um sitemap

Raramente é preciso escrever um à mão. O WordPress gera um sitemap básico em /wp-sitemap.xml desde a versão 5.5, e os plugins de SEO o substituem pelo deles; a Shopify e a maioria dos construtores de sites hospedados criam o /sitemap.xml automaticamente; no Next.js, um arquivo app/sitemap.ts gera um. Depois que ele existir, avise os mecanismos de busca de onde ele está de duas maneiras: adicione uma linha Sitemap: ao robots.txt e envie-o no relatório Sitemaps do Google Search Console (e no Bing Webmaster Tools). O Search Console então mostra se o arquivo pôde ser lido e quantas das URLs dele estão indexadas.

Como verificar o seu robots.txt e o seu sitemap

Comece abrindo os dois arquivos no navegador: /robots.txt e a URL do sitemap. Depois, passe a página que interessa pelo verificador de SEO gratuito do Rudra. Ele busca o seu robots.txt e informa se o arquivo bloqueia a página testada para o user-agent genérico * e se declara um sitemap. Em seguida, procura o sitemap (no local declarado ou, na falta dele, em /sitemap.xml e /sitemap_index.xml), confere se ele pode ser interpretado como sitemap ou índice de sitemaps e informa se as entradas trazem datas em lastmod e se a URL testada está listada.

Para a visão do próprio Google, use o relatório de robots.txt e a ferramenta Inspeção de URL do Search Console, que mostram se uma URL específica está bloqueada e se está indexada.

Erros comuns

  • Lançar o site com o robots.txt de staging. Um Disallow: / esquecido da fase de desenvolvimento pode bloquear o site inteiro em produção. Confira o robots.txt no dia do lançamento.
  • Bloquear CSS e JavaScript de que as páginas precisam para renderizar, de modo que o Google não consegue ver a página como os visitantes veem.
  • Usar o robots.txt para remover páginas do Google. Use noindex (e deixe a página ser rastreada) ou, em casos urgentes, a ferramenta Remoções do Search Console.
  • Combinar um bloqueio no robots.txt com noindex na mesma página, o que impede que o noindex seja visto.
  • Listar as URLs erradas no sitemap: redirecionamentos, páginas 404, páginas com noindex, versões em http:// ou um domínio diferente.
  • Definir todas as datas de lastmod como hoje a cada build, o que torna as datas inúteis para os mecanismos de busca.
  • Um robots.txt que retorna erro de servidor. O Google trata um robots.txt ausente (404) como "rastreie tudo", mas um erro 5xx pode fazê-lo parar de rastrear o site até o arquivo voltar a ficar disponível.

Perguntas frequentes

Preciso de um arquivo robots.txt?

Não necessariamente. Se não há nada de que você queira manter os rastreadores afastados, dá para dispensá-lo; um robots.txt que retorna 404 significa que tudo pode ser rastreado. Ainda assim, muitos sites adicionam um para bloquear áreas de pouco valor, como os resultados da busca interna, e para apontar para o sitemap.

Preciso de um sitemap XML?

Sites pequenos com bons links internos costumam ser encontrados sem ele, mas um sitemap custa pouco e ajuda os mecanismos de busca a achar páginas novas e atualizadas mais depressa. Sites grandes, sites novos e sites com páginas profundas ou mal interligadas são os que mais se beneficiam.

Adicionar uma página ao sitemap faz com que ela seja indexada?

Não. Um sitemap ajuda os mecanismos de busca a descobrir URLs, mas a indexação de uma página depende da qualidade dela, de ela duplicar ou não outras páginas e de ela poder ser rastreada e não estar marcada com noindex.

Como bloquear rastreadores de IA com o robots.txt?

Adicione um grupo de user-agent para cada rastreador que você quer bloquear, como GPTBot (OpenAI) ou CCBot (Common Crawl), com Disallow: /. O Google-Extended controla se o Google pode usar o seu conteúdo nos modelos de IA dele, sem afetar a Busca do Google. Essas regras só funcionam com rastreadores que decidem respeitar o robots.txt.

Onde o robots.txt e o sitemap.xml devem ficar?

O robots.txt precisa estar na raiz de cada host, como em https://example.com/robots.txt. Um sitemap pode ficar em qualquer lugar do host, mas /sitemap.xml é a convenção; declare a localização dele no robots.txt e envie-o no Google Search Console.

Precisa de uma análise mais profunda do seu site?

Veja todos os problemas do seu site, na ordem em que vale a pena corrigir

Verifique qualquer página gratuitamente, sem conta, ou cadastre-se para rastrear o site inteiro. Cada relatório cobre SEO, problemas comuns de desempenho, acessibilidade e segurança, com uma correção sugerida para cada problema.