O que é robots.txt: guia completo

09 de Agosto, 2026
Equipe Searchfy
8 min de leitura

Um arquivo de texto com poucas linhas pode, sozinho, tirar um site inteiro dos resultados de busca — ou proteger áreas que não deveriam ser rastreadas. Esse arquivo é o robots.txt, e entender como ele funciona é básico para qualquer site.

Neste guia, você vai entender o que é o robots.txt, como ele funciona na prática, as regras mais comuns e os erros que mais prejudicam sites por engano.

O que é o robots.txt

Robots.txt é um arquivo de texto simples, localizado na raiz do domínio (por exemplo, seudominio.com/robots.txt), que instrui robôs de busca sobre quais partes do site podem ou não ser rastreadas. Ele segue um padrão técnico chamado Robots Exclusion Protocol, respeitado voluntariamente pela maioria dos buscadores sérios — Google, Bing e outros.

É importante entender que o robots.txt funciona por convenção: ele não é uma barreira de segurança real. Bots mal-intencionados podem simplesmente ignorá-lo. Ele serve para orientar o comportamento de rastreadores legítimos, não para proteger informação sensível.

Como o robots.txt funciona

O arquivo usa uma sintaxe simples baseada em "agentes" (user-agents, ou seja, qual robô a regra se aplica) e "regras" (o que esse robô pode ou não rastrear). Um exemplo básico:

  • User-agent: * — a regra abaixo se aplica a todos os robôs
  • Disallow: /admin/ — bloqueia o rastreamento de tudo dentro de "/admin/"
  • Allow: / — permite rastreamento do restante do site
  • Sitemap: https://seudominio.com/sitemap.xml — declara onde está o sitemap

É possível criar regras diferentes por robô, direcionando instruções específicas para Googlebot, Bingbot ou qualquer outro user-agent nomeado.

Robots.txt não é a mesma coisa que noindex

Essa é a confusão mais comum sobre o assunto. Bloquear uma URL no robots.txt impede o rastreamento — o robô não vai acessar o conteúdo daquela página. Mas se outras páginas linkarem para essa URL, o Google ainda pode incluí-la nos resultados, exibindo um resultado sem título ou descrição próprios, montado a partir dos links que apontam para ela.

Para realmente impedir que uma página apareça nos resultados de busca, a ferramenta correta é a tag noindex (via meta tag ou header HTTP) — e, para que o Google veja essa instrução, a página precisa continuar rastreável, ou seja, não pode estar bloqueada no robots.txt ao mesmo tempo.

Quando usar robots.txt

  • Áreas administrativas: painéis de login, dashboards internos, áreas de checkout em processamento.
  • Páginas duplicadas geradas por filtros: URLs com parâmetros de busca interna, ordenação ou paginação que não agregam valor único para indexação.
  • Arquivos técnicos: scripts, arquivos de configuração e outros recursos que não fazem sentido aparecer em resultados de busca.
  • Declarar o sitemap: mesmo quando não há nada para bloquear, vale manter um robots.txt simples só para apontar o caminho do sitemap.xml.

Erros comuns e graves no robots.txt

  • Bloquear o site inteiro por engano: a regra Disallow: / sob User-agent: * bloqueia todo o rastreamento do site. É comum acontecer após migrações ou deploys mal configurados — e pode derrubar a visibilidade orgânica em poucas semanas se não for corrigido rápido.
  • Bloquear CSS e JavaScript: o Google precisa rastrear esses arquivos para renderizar a página corretamente e avaliar experiência do usuário. Bloqueá-los prejudica a forma como o Google "vê" o site.
  • Confundir robots.txt com controle de indexação: tentar "esconder" uma página do Google só via robots.txt, sem noindex, muitas vezes não funciona como esperado.
  • Não declarar o sitemap: perde uma forma simples e direta de ajudar buscadores a encontrar o arquivo de mapeamento do site.

Como testar o robots.txt

O Google Search Console oferece uma ferramenta de teste de robots.txt, que mostra exatamente se uma URL específica está bloqueada ou permitida segundo as regras vigentes. Também é possível simplesmente abrir seudominio.com/robots.txt no navegador a qualquer momento para conferir o conteúdo publicado — é um arquivo público, acessível por qualquer pessoa.

Conclusão

Robots.txt é um arquivo pequeno, mas com poder desproporcional sobre a saúde técnica de SEO de um site — um erro de uma linha pode bloquear o rastreamento inteiro, e uma configuração ausente ou mal pensada deixa oportunidades de indexação eficiente na mesa.

Junto com o sitemap.xml, o robots.txt forma a dupla básica de sinalização técnica que orienta como o Google rastreia e indexa o seu site. Vale revisar os dois arquivos periodicamente, principalmente após mudanças estruturais no site.