📚 Relacionado: link building interno estrategia autoridade • site para dentista em braco do norte sc • criacao de sites em ribeirao preto sp

O site estava em desenvolvimento e alguém, corretamente, bloqueou o Google de indexar aquela versão de teste. Três meses depois, o site foi ao ar oficialmente — mas ninguém lembrou de tirar aquele bloqueio. Resultado: um site pronto, bonito, no ar, e completamente invisível pro Google, por uma única linha de código esquecida.
Isso é exagero? Não. A Desenvolve Sites vê esse cenário a cada trimestre. Um robots.txt mal configurado destrói SEO sem qualquer sinal de alerta. Este guia mostra como controlá-lo corretamente.
O que é robots.txt e por que importa
Robots.txt é um arquivo de texto que fica na raiz do seu site (seudominio.com/robots.txt) e diz aos robôs de busca (Google, Bing, etc) quais partes do seu site podem ser rastreadas. Ele não proíbe indexação diretamente — proíbe rastreamento. Diferença importante.
Pense no robots.txt como as placas de uma avenida: "Essa rua é aberta ao trânsito", "Essa via é proibida". O Google lê a placa e segue a regra.
Por que controlar rastreamento?
Você não quer que Google gaste tempo rastreando:
- Páginas administrativas (login, painel de controle)
- Arquivos privados ou internos
- Páginas de teste ou desenvolvimento
- Versões duplicadas do mesmo conteúdo
- Páginas muito pesadas que drenam o "orçamento de rastreamento"
Se o Google gastar energia rastreando lixo, sobra menos energia para rastrear suas páginas importantes. Robots.txt ajuda a priorizar.
Onde fica e como funciona
O arquivo sempre fica em seudominio.com/robots.txt. Ele usa diretivas simples organizadas por user-agent (tipo de robô). Exemplo:
```
User-agent: Googlebot
Disallow: /admin/
Disallow: /checkout/
Allow: /checkout/confirmacao/
Disallow: *.pdf$
User-agent: *
Disallow: /privado/
Sitemap: https://seudominio.com/sitemap.xml
```
User-agent: Googlebot = regras específicas pro Google
User-agent: * = regras para todos os robôs
Disallow: = bloqueia rastreamento
Allow: = permite explicitamente (sobrescreve Disallow)
$ = fim da string (*.pdf$ = PDF no final do caminho)
O erro mais comum e mais grave
Deixar a linha Disallow: / ativa por engano — geralmente esquecida de quando o site estava em desenvolvimento — bloqueia completamente o rastreamento de todo o site, mesmo que ele esteja no ar e funcionando normalmente.
Uma única barra (/) significa "tudo". Seu site invisível pro Google por um caractere.
Estratégia de bloqueio: o que faz sentido bloquear
Bloqueie com sabedoria. Nem tudo que é privado precisa estar no robots.txt:
Boa aplicação de robots.txt
- Áreas administrativas:
/admin/,/wp-admin/,/control/ - Páginas de checkout intermediárias:
/carrinho/,/pagamento-processando/ - Páginas de agradecimento:
/obrigado/,/confirmacao/ - Versões duplicadas:
/print/,/amp/(se prefere não indexar) - Recursos pesados:
.pdf,.zip
```
User-agent: Googlebot
Disallow: /admin/
Disallow: /checkout/
Disallow: /obrigado/
Disallow: /*.pdf$
Allow: /checkout/confirmacao/
```
Má aplicação de robots.txt
Não use robots.txt para bloquear conteúdo sensível. Qualquer pessoa com o link direto acessa. Use autenticação para isso.
Não use robots.txt para bloquear páginas que devem aparecer em buscas — use meta noindex para isso (veremos depois).
Robots.txt vs Meta Noindex: qual usar?
Essa é a dúvida que mata: quando bloqueio no robots.txt e quando uso meta noindex?
Robots.txt (Disallow):
- Impede rastreamento
- Economiza recursos de rastreamento
- Página não aparece no Google
- Bom para: admin, checkout, testes
Meta Noindex:
- Permite rastreamento, mas proíbe indexação
- Google ainda acaricia a página
- Conteúdo não aparece em buscas, mas Google sabe que existe
- Bom para: páginas antigas, páginas duplicadas que precisam existir, versões de baixa qualidade
Regra prática:
- Página que ninguém deveria acessar? → Robots.txt
- Página que pode existir, mas não deveria ranquear? → Meta noindex
- Página sensível mesmo com link direto? → Autenticação + senha
Crawl Budget: por que economizar rastreamento
Google não rastreia seu site infinitamente. Cada site tem um "orçamento" de rastreamento — quantas páginas o Googlebot vai visitar por dia. Sites com muito conteúdo lixo (páginas duplicadas, erros 404, loops de parâmetro) gastam budget em lixo.
Resultado: suas páginas boas não são rastreadas frequentemente.
Robots.txt bem configurado = mais budget para conteúdo importante.
Um exemplo: um site de e-commerce com 500 produtos, mas 5000 variações de filtro (produto.php?cor=azul&tamanho=P&material=algodao). Sem robots.txt, Google gasta budget rastreando 5000 URLs que são essencialmente a mesma página.
Solução: bloquear parâmetros de filtro no robots.txt, deixar apenas as 500 páginas reais serem rastreadas.
```
User-agent: Googlebot
Disallow: /*?
Allow: /*.php?id=
```
Isso melhora a eficiência drasticamente.
Robots.txt não é uma medida de segurança
Bloquear uma página no robots.txt impede que ela seja indexada normalmente, mas não a torna privada ou inacessível — qualquer pessoa com o link direto ainda consegue acessá-la. O arquivo robots.txt é público: seudominio.com/robots.txt. Qualquer um vê o que você está bloqueando.
Para conteúdo realmente sensível, use autenticação (senha HTTP ou token).
Exemplo de robots.txt robusto para site pequeno
```
User-agent: Googlebot
Crawl-delay: 1
Allow: /
Disallow: /admin/
Disallow: /painel/
Disallow: /usuarios/
Disallow: /privado/
Disallow: /teste/
Disallow: /?
Disallow: /*.pdf$
Disallow: /checkout/
User-agent: *
Disallow: /
Sitemap: https://seudominio.com.br/sitemap.xml
```
Crawl-delay: aguarda 1 segundo entre requisições (respeita servidor)
Allow: / após Disallow específicos = permite tudo que não está bloqueado
Monitorando seu robots.txt: como saber se está funcionando
Não é o-que-que-sé vendo — é confirmação técnica.
Como testar e validar seu robots.txt
O Google Search Console tem um testador integrado:
- Acesse Google Search Console (
search.google.com/search-console) - Selecione sua propriedade
- Vá em "Configurações" > "Regras de robots.txt"
- Teste URLs específicas para ver se estão bloqueadas
Você digita /admin/qualquercoisa e o Search Console simula se o Googlebot consegue rastrear. Resultado: "Bloqueado" ou "Permitido".
Também existe validação sintática: o arquivo está bem escrito? Sem erros de digitação?
Dica: Teste a URL que mais importa para você. Se ela estiver bloqueada por engano, acha rápido.
Sempre inclua a referência ao sitemap
É uma boa prática adicionar a linha Sitemap: https://seudominio.com/sitemap.xml no final do arquivo robots.txt, ajudando os robôs a encontrarem o mapa completo do site automaticamente. O sitemap é teu "mapa de tesouro" pro Google — reduz tempo de descoberta e indexação.
Exemplo de robots.txt real: blog WordPress
```
User-agent: *
Disallow: /wp-admin/
Disallow: /wp-login.php
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /?s=
Disallow: /*/feed/
Disallow: /trackback/
Disallow: /author/
Allow: /wp-content/uploads/
Sitemap: https://seusite.com.br/sitemap.xml
```
Essa configuração:
- Bloqueia admin e login
- Bloqueia arquivos internos do WordPress
- Bloqueia páginas de busca duplicadas (
?s=) - Bloqueia feeds duplicados
- Permite imagens e uploads
- Aponta o Google pro sitemap
Erros comuns que destroem SEO
1. Disallow: / ativo em produção
Um site inteiro invisível porque alguém coprou robots.txt de desenvolvimento para produção. Catástrofe silenciosa.
2. Bloquear tudo exceto homepage
Alguns criam Disallow: / e depois tentam Allow: /$. Não funciona — Disallow: / bloqueia tudo, ponto.
3. Sintaxe errada
Disalow: (falta o w), user-agent: (com hífen, não underscore). Google ignora linhas inválidas.
4. Mudar robots.txt sem testar
Você muda, espera semanas achando que é normal, depois descobre que rastreamento estava bloqueado. Teste antes de publicar.
Próximos passos: auditoria completa
Se você tem site, comece hoje:
- Acesse
seudominio.com/robots.txt - Se encontrar
Disallow: /, isso é o erro - Abra Search Console, vá em "Regras de robots.txt", teste uma página importante
- Se ela aparecer como "Bloqueada", corrija agora
A Desenvolve Sites ajuda sites que "sumiram" do Google por problemas técnicos simples como esse. Uma auditoria completa identifica robots.txt ruins, meta noindex esquecido, canonical tags erradas.
Depois de garantir que o rastreamento está liberado, o próximo ajuste rápido é a fórmula de meta description que aumenta CTR — de nada adianta ser rastreado se o snippet não convence ninguém a clicar.
Depois de liberar o rastreamento no robots.txt, o próximo ajuste técnico é o schema markup, que aumenta a visibilidade nos resultados de busca.
Perguntas Frequentes
Preciso mesmo de robots.txt? Posso deixar vazio?
Não é obrigatório, mas é proteção mínima. Se seu site é simples e tudo deve ser rastreado, um robots.txt vazio (só com sitemap) já ajuda. Melhor ter que não ter.
Quanto tempo leva pro Google reconhecer mudanças no robots.txt?
Google verifica diariamente, normalmente. Mudar o arquivo e segundos depois testar no Search Console não reflete na busca real — pode levar 24 horas. Tenha paciência.
Posso usar robots.txt pra esconder conteúdo de concorrentes?
Não. Robots.txt é público. Qualquer pessoa vê o arquivo. Se quer segurança, use autenticação. Robots.txt é pra controlar rastreamento, não segurança.
E-commerce: devo bloquear variações de produto?
Sim. Se você tem 1000 produtos mas 100mil URLs de filtro, bloqueie:
```
Disallow: /*?
Allow: /produto.php?id=
```
Isso libera apenas URLs com "id=" e bloqueia o resto. Economiza budget.
Site migrou de HTTP pra HTTPS — robots.txt antigo ainda funciona?
Não. Robots.txt é específico do protocolo. http://site.com/robots.txt não controla https://site.com. Crie novo robots.txt no HTTPS e ative redirect de HTTP pra HTTPS.