Estratégia

Robots.txt: Controlar Rastreamento Google

Por Eduardo Mendonça
Robots.txt: Controlar Rastreamento Google

📚 Relacionado: link building interno estrategia autoridadesite para dentista em braco do norte sccriacao de sites em ribeirao preto sp

Robots.txt: controlar rastreamento do Google

O site estava em desenvolvimento e alguém, corretamente, bloqueou o Google de indexar aquela versão de teste. Três meses depois, o site foi ao ar oficialmente — mas ninguém lembrou de tirar aquele bloqueio. Resultado: um site pronto, bonito, no ar, e completamente invisível pro Google, por uma única linha de código esquecida.

Isso é exagero? Não. A Desenvolve Sites vê esse cenário a cada trimestre. Um robots.txt mal configurado destrói SEO sem qualquer sinal de alerta. Este guia mostra como controlá-lo corretamente.

O que é robots.txt e por que importa

Robots.txt é um arquivo de texto que fica na raiz do seu site (seudominio.com/robots.txt) e diz aos robôs de busca (Google, Bing, etc) quais partes do seu site podem ser rastreadas. Ele não proíbe indexação diretamente — proíbe rastreamento. Diferença importante.

Pense no robots.txt como as placas de uma avenida: "Essa rua é aberta ao trânsito", "Essa via é proibida". O Google lê a placa e segue a regra.

Por que controlar rastreamento?

Você não quer que Google gaste tempo rastreando:

Se o Google gastar energia rastreando lixo, sobra menos energia para rastrear suas páginas importantes. Robots.txt ajuda a priorizar.

Onde fica e como funciona

O arquivo sempre fica em seudominio.com/robots.txt. Ele usa diretivas simples organizadas por user-agent (tipo de robô). Exemplo:

```

User-agent: Googlebot

Disallow: /admin/

Disallow: /checkout/

Allow: /checkout/confirmacao/

Disallow: *.pdf$

User-agent: *

Disallow: /privado/

Sitemap: https://seudominio.com/sitemap.xml

```

User-agent: Googlebot = regras específicas pro Google

User-agent: * = regras para todos os robôs

Disallow: = bloqueia rastreamento

Allow: = permite explicitamente (sobrescreve Disallow)

$ = fim da string (*.pdf$ = PDF no final do caminho)

O erro mais comum e mais grave

Deixar a linha Disallow: / ativa por engano — geralmente esquecida de quando o site estava em desenvolvimento — bloqueia completamente o rastreamento de todo o site, mesmo que ele esteja no ar e funcionando normalmente.

Uma única barra (/) significa "tudo". Seu site invisível pro Google por um caractere.

Estratégia de bloqueio: o que faz sentido bloquear

Bloqueie com sabedoria. Nem tudo que é privado precisa estar no robots.txt:

Boa aplicação de robots.txt

```

User-agent: Googlebot

Disallow: /admin/

Disallow: /checkout/

Disallow: /obrigado/

Disallow: /*.pdf$

Allow: /checkout/confirmacao/

```

Má aplicação de robots.txt

Não use robots.txt para bloquear conteúdo sensível. Qualquer pessoa com o link direto acessa. Use autenticação para isso.

Não use robots.txt para bloquear páginas que devem aparecer em buscas — use meta noindex para isso (veremos depois).

Robots.txt vs Meta Noindex: qual usar?

Essa é a dúvida que mata: quando bloqueio no robots.txt e quando uso meta noindex?

Robots.txt (Disallow):

Meta Noindex:

Regra prática:

Crawl Budget: por que economizar rastreamento

Google não rastreia seu site infinitamente. Cada site tem um "orçamento" de rastreamento — quantas páginas o Googlebot vai visitar por dia. Sites com muito conteúdo lixo (páginas duplicadas, erros 404, loops de parâmetro) gastam budget em lixo.

Resultado: suas páginas boas não são rastreadas frequentemente.

Robots.txt bem configurado = mais budget para conteúdo importante.

Um exemplo: um site de e-commerce com 500 produtos, mas 5000 variações de filtro (produto.php?cor=azul&tamanho=P&material=algodao). Sem robots.txt, Google gasta budget rastreando 5000 URLs que são essencialmente a mesma página.

Solução: bloquear parâmetros de filtro no robots.txt, deixar apenas as 500 páginas reais serem rastreadas.

```

User-agent: Googlebot

Disallow: /*?

Allow: /*.php?id=

```

Isso melhora a eficiência drasticamente.

Robots.txt não é uma medida de segurança

Bloquear uma página no robots.txt impede que ela seja indexada normalmente, mas não a torna privada ou inacessível — qualquer pessoa com o link direto ainda consegue acessá-la. O arquivo robots.txt é público: seudominio.com/robots.txt. Qualquer um vê o que você está bloqueando.

Para conteúdo realmente sensível, use autenticação (senha HTTP ou token).

Exemplo de robots.txt robusto para site pequeno

```

User-agent: Googlebot

Crawl-delay: 1

Allow: /

Disallow: /admin/

Disallow: /painel/

Disallow: /usuarios/

Disallow: /privado/

Disallow: /teste/

Disallow: /?

Disallow: /*.pdf$

Disallow: /checkout/

User-agent: *

Disallow: /

Sitemap: https://seudominio.com.br/sitemap.xml

```

Crawl-delay: aguarda 1 segundo entre requisições (respeita servidor)

Allow: / após Disallow específicos = permite tudo que não está bloqueado

Monitorando seu robots.txt: como saber se está funcionando

Não é o-que-que-sé vendo — é confirmação técnica.

Como testar e validar seu robots.txt

O Google Search Console tem um testador integrado:

  1. Acesse Google Search Console (search.google.com/search-console)
  2. Selecione sua propriedade
  3. Vá em "Configurações" > "Regras de robots.txt"
  4. Teste URLs específicas para ver se estão bloqueadas

Você digita /admin/qualquercoisa e o Search Console simula se o Googlebot consegue rastrear. Resultado: "Bloqueado" ou "Permitido".

Também existe validação sintática: o arquivo está bem escrito? Sem erros de digitação?

Dica: Teste a URL que mais importa para você. Se ela estiver bloqueada por engano, acha rápido.

Sempre inclua a referência ao sitemap

É uma boa prática adicionar a linha Sitemap: https://seudominio.com/sitemap.xml no final do arquivo robots.txt, ajudando os robôs a encontrarem o mapa completo do site automaticamente. O sitemap é teu "mapa de tesouro" pro Google — reduz tempo de descoberta e indexação.

Exemplo de robots.txt real: blog WordPress

```

User-agent: *

Disallow: /wp-admin/

Disallow: /wp-login.php

Disallow: /wp-includes/

Disallow: /wp-content/plugins/

Disallow: /wp-content/themes/

Disallow: /?s=

Disallow: /*/feed/

Disallow: /trackback/

Disallow: /author/

Allow: /wp-content/uploads/

Sitemap: https://seusite.com.br/sitemap.xml

```

Essa configuração:

Erros comuns que destroem SEO

1. Disallow: / ativo em produção

Um site inteiro invisível porque alguém coprou robots.txt de desenvolvimento para produção. Catástrofe silenciosa.

2. Bloquear tudo exceto homepage

Alguns criam Disallow: / e depois tentam Allow: /$. Não funciona — Disallow: / bloqueia tudo, ponto.

3. Sintaxe errada

Disalow: (falta o w), user-agent: (com hífen, não underscore). Google ignora linhas inválidas.

4. Mudar robots.txt sem testar

Você muda, espera semanas achando que é normal, depois descobre que rastreamento estava bloqueado. Teste antes de publicar.


Próximos passos: auditoria completa

Se você tem site, comece hoje:

  1. Acesse seudominio.com/robots.txt
  2. Se encontrar Disallow: /, isso é o erro
  3. Abra Search Console, vá em "Regras de robots.txt", teste uma página importante
  4. Se ela aparecer como "Bloqueada", corrija agora

A Desenvolve Sites ajuda sites que "sumiram" do Google por problemas técnicos simples como esse. Uma auditoria completa identifica robots.txt ruins, meta noindex esquecido, canonical tags erradas.

Depois de garantir que o rastreamento está liberado, o próximo ajuste rápido é a fórmula de meta description que aumenta CTR — de nada adianta ser rastreado se o snippet não convence ninguém a clicar.

Depois de liberar o rastreamento no robots.txt, o próximo ajuste técnico é o schema markup, que aumenta a visibilidade nos resultados de busca.

Perguntas Frequentes

Preciso mesmo de robots.txt? Posso deixar vazio?

Não é obrigatório, mas é proteção mínima. Se seu site é simples e tudo deve ser rastreado, um robots.txt vazio (só com sitemap) já ajuda. Melhor ter que não ter.

Quanto tempo leva pro Google reconhecer mudanças no robots.txt?

Google verifica diariamente, normalmente. Mudar o arquivo e segundos depois testar no Search Console não reflete na busca real — pode levar 24 horas. Tenha paciência.

Posso usar robots.txt pra esconder conteúdo de concorrentes?

Não. Robots.txt é público. Qualquer pessoa vê o arquivo. Se quer segurança, use autenticação. Robots.txt é pra controlar rastreamento, não segurança.

E-commerce: devo bloquear variações de produto?

Sim. Se você tem 1000 produtos mas 100mil URLs de filtro, bloqueie:

```

Disallow: /*?

Allow: /produto.php?id=

```

Isso libera apenas URLs com "id=" e bloqueia o resto. Economiza budget.

Site migrou de HTTP pra HTTPS — robots.txt antigo ainda funciona?

Não. Robots.txt é específico do protocolo. http://site.com/robots.txt não controla https://site.com. Crie novo robots.txt no HTTPS e ative redirect de HTTP pra HTTPS.

Leia também

Quer aplicar isso no seu negócio?

Avaliamos seu projeto gratuitamente e mostramos onde estão as oportunidades.

Falar com Especialista →