Robots.txt é um arquivo de texto usado para informar aos rastreadores dos mecanismos de busca quais áreas de um site podem ou não ser acessadas.

Ele funciona como uma orientação para robôs como o Googlebot. Antes de rastrear um site, esses robôs podem consultar o arquivo para identificar páginas, diretórios ou arquivos que possuem alguma restrição de acesso.

O arquivo deve estar na raiz do domínio, geralmente neste formato:

https://exemplo.com/robots.txt

O robots.txt controla principalmente o rastreamento. Ele não deve ser usado como forma de esconder informações privadas nem como garantia de que uma página desaparecerá dos resultados de busca.

Para que serve o robots.txt?

O arquivo pode ajudar a organizar o acesso dos rastreadores e evitar que eles gastem tempo visitando áreas sem importância para os resultados de pesquisa.

Ele pode ser utilizado para:

  • bloquear o rastreamento de determinados diretórios;
  • impedir o acesso de um rastreador específico;
  • liberar exceções dentro de uma área bloqueada;
  • controlar o acesso a determinados tipos de arquivo;
  • indicar o endereço do sitemap;
  • reduzir solicitações desnecessárias ao servidor.

Um site pequeno e bem organizado pode funcionar normalmente com uma configuração simples. Alterações complexas só devem ser feitas quando existe uma razão técnica clara.

Como funciona o robots.txt?

O arquivo é composto por grupos de instruções. Cada grupo informa a qual rastreador as regras se aplicam e quais caminhos podem ou não ser acessados.

Um exemplo simples seria:

User-agent: *
Disallow: /area-restrita/

Sitemap: https://exemplo.com/sitemap_index.xml

Nesse exemplo:

User-agent: * indica que a regra se aplica aos rastreadores em geral.

Disallow: /area-restrita/ solicita que o diretório indicado não seja rastreado.

Sitemap: informa o endereço completo do sitemap do site.

Quando nenhuma área é bloqueada, o comportamento padrão é permitir o rastreamento. As regras diferenciam letras maiúsculas e minúsculas nos caminhos, portanto /Pasta/ e /pasta/ podem ser interpretadas como endereços diferentes.

Principais instruções do arquivo

User-agent

Identifica para qual rastreador as regras foram criadas.

User-agent: Googlebot

O asterisco pode ser usado para representar vários rastreadores:

User-agent: *

Disallow

Informa um caminho que não deve ser rastreado.

Disallow: /pagina-interna/

Para bloquear todo o site:

User-agent: *
Disallow: /

Essa configuração exige extremo cuidado. Um único caractere pode impedir que todas as páginas sejam rastreadas.

Allow

Libera uma página ou um diretório dentro de uma área que possui uma restrição maior.

User-agent: *
Disallow: /arquivos/
Allow: /arquivos/publicos/

Sitemap

Apresenta aos rastreadores o endereço do sitemap.

Sitemap: https://exemplo.com/sitemap_index.xml

A URL precisa ser completa, incluindo o protocolo e o domínio. É possível informar mais de um sitemap no mesmo arquivo.

Robots.txt impede a indexação?

Não necessariamente.

Uma página bloqueada pelo robots.txt ainda pode ter seu endereço encontrado por meio de links externos ou internos. Nesse caso, o Google pode mostrar a URL nos resultados, mesmo sem ter acessado o conteúdo completo.

Por isso, o robots.txt não é a ferramenta correta para remover uma página dos resultados.

Para impedir a indexação, normalmente é necessário usar:

  • uma regra noindex;
  • proteção por senha;
  • controle de acesso no servidor;
  • remoção da página quando ela não deve mais existir.

Existe um cuidado importante: se uma página estiver bloqueada no robots.txt, o Google não conseguirá acessá-la para encontrar a regra noindex. Por isso, não se deve bloquear o rastreamento de uma página que precisa ser lida para que o noindex funcione.

Robots.txt protege informações privadas?

Não.

O arquivo robots.txt pode ser acessado publicamente por qualquer pessoa. Basta digitar o domínio seguido de /robots.txt.

Além disso, as regras funcionam como orientações. Rastreadores confiáveis costumam respeitá-las, mas outros robôs podem ignorá-las.

Áreas administrativas, dados pessoais, documentos confidenciais e conteúdos pagos devem ser protegidos com senha, autenticação e configurações de segurança adequadas. O robots.txt não substitui essas medidas.

Como configurar no Rank Math?

O Rank Math pode gerar um arquivo robots.txt virtual no WordPress. Isso significa que o endereço funciona mesmo quando não existe um arquivo físico dentro da pasta principal da hospedagem.

Para consultar o arquivo do seu site, acesse:

https://seudominio.com/robots.txt

Para editar no Rank Math:

  1. Entre no painel do WordPress.
  2. Acesse Rank Math SEO.
  3. Ative o Modo Avançado, caso ainda esteja desativado.
  4. Entre em Configurações Gerais.
  5. Abra a área Editar robots.txt.
  6. Revise as regras antes de salvar.

Caso exista um arquivo físico robots.txt na raiz da hospedagem, ele pode impedir que o Rank Math controle a versão virtual. Nesse caso, a configuração precisa ser conferida no gerenciador de arquivos ou por FTP.

Exemplo comum para WordPress

Uma configuração simples pode ter esta aparência:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://exemplo.com/sitemap_index.xml

Ela solicita que os rastreadores não acessem diretamente a área administrativa, mas libera o arquivo necessário para determinadas funções do WordPress.

Esse exemplo não deve ser copiado sem verificar o endereço correto do sitemap e as necessidades do site.

Erros comuns

Bloquear todo o site por acidente

A regra abaixo impede o rastreamento de todas as páginas:

Disallow: /

Ela pode ser útil em situações específicas, mas é perigosa em um site que já deveria aparecer no Google.

Usar robots.txt para ocultar páginas

Bloquear o rastreamento não garante a remoção da URL dos resultados.

Bloquear arquivos importantes

Impedir o acesso a arquivos CSS, JavaScript ou imagens essenciais pode dificultar a compreensão e a renderização das páginas pelo Google.

Criar regras sem necessidade

Quanto mais complexa a configuração, maior o risco de bloquear uma área importante. Um arquivo simples e correto costuma ser melhor que várias regras desnecessárias.

Em resumo

Robots.txt é um arquivo que orienta os rastreadores sobre quais partes de um site podem ser acessadas.

Ele pode ajudar no controle do rastreamento, na organização técnica do site e na indicação do sitemap. Porém, não garante a remoção de páginas dos resultados e não protege conteúdos privados.

Qualquer alteração deve ser feita com cuidado, principalmente em sites WordPress que utilizam o Rank Math.

Explore também

Aprofunde o assunto

✅ Na prática

Acesse o endereço /robots.txt do seu site e verifique:

  1. O arquivo abre normalmente?
  2. Existe alguma regra Disallow: /?
  3. O painel administrativo está bloqueado?
  4. O endereço do sitemap está correto?
  5. Algum diretório importante foi bloqueado?
  6. O Rank Math está controlando uma versão virtual?
  7. Existe outro arquivo físico causando conflito?

Não altere regras apenas porque encontrou um modelo pronto na internet. Primeiro, entenda o que cada linha faz.

💡 Você sabia?

O Google normalmente atualiza a cópia armazenada do robots.txt durante novos rastreamentos. Por isso, uma alteração pode não produzir efeito imediato em todas as páginas.