Verificador de Robots.txt

Cole suas regras de robots.txt e o caminho de URL que você quer testar, e o verificador lê as linhas Allow e Disallow para dizer se esse caminho seria bloqueado ou permitido. Útil quando uma página some de repente do Google e você quer confirmar se um Disallow exagerado é a causa, ou quando está redigindo novas regras e quer verificar um caminho antes de publicar o arquivo.

Como o verificador funciona

  1. 1

    Cole suas regras

    Copie as linhas Allow e Disallow do seu robots.txt na caixa, ou redija novas para testá-las.

  2. 2

    Digite um caminho para testar

    Digite o caminho de URL que você quer verificar, por exemplo /private/page. Use apenas o caminho, não o domínio completo.

  3. 3

    Verifique a regra

    O verificador analisa as linhas Allow e Disallow e encontra qual corresponde ao caminho que você digitou.

  4. 4

    Leia o veredito

    Você obtém o número de regras encontradas, o caminho testado e a decisão: permitido por padrão, bloqueado por um Disallow ou permitido por um Allow.

Um robots.txt mínimo e correto

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: *. Aplica-se a qualquer crawler não explicitamente nomeado em outro bloco.
  • Allow: /. Tudo permitido por padrão.
  • Disallow: /admin/. O diretório de administração está fora dos limites.
  • Sitemap:. Informa aos motores de busca onde encontrar o sitemap XML.

Regras que o Googlebot realmente segue

O parser do Google é o padrão de fato para interpretar regras ambíguas:

  • Caminhos sensíveis a maiúsculas. /Admin/ e /admin/ são diferentes.
  • O maior match vence. Allow: /admin/public/ supera Disallow: /admin/ para uma URL que começa com /admin/public/.
  • Curingas. * corresponde a qualquer sequência de caracteres; $ ancla no final da URL.
  • Comentários começam com #.
  • Independente de ordem. As regras são avaliadas pela especificidade (comprimento do caminho), não pela ordem de listagem.

Erros comuns

Erro Efeito
Disallow: / no topo, sem Allow Site inteiro bloqueado
Disallow: *.pdf Muitos parsers ignoram, use Disallow: /*.pdf$
URL relativa ao protocolo ou absoluta em Disallow Ignorado, caminhos devem ser relativos
Múltiplas linhas User-agent antes das regras Combinadas; regras se aplicam a todos os UAs listados
Espaços em branco no final dos caminhos Silenciosamente tratado como caminho diferente
Colocando robots.txt em um subdiretório Apenas o arquivo do domínio raiz é buscado

robots.txt vs noindex

robots.txt informa aos crawlers não buscar uma URL. Uma página que já está indexada e depois bloqueada no robots.txt pode permanecer indexada por meses, o crawler não pode buscá-la para confirmar a remoção. Se você quiser que ela saia do índice, use uma tag meta noindex ou cabeçalho HTTP na própria página e deixe o crawler vê-la.

Crawl-delay

Crawl-delay: 10 solicita 10 segundos entre as requisições. O Google ignora isso (use o Search Console para definir a taxa de rastreamento). Bing, Yandex e alguns crawlers de nicho respeitam. Use para sites pequenos sob pressão de rastreamento de bots de nicho.

O que Disallow NÃO faz

  • Bloquear de ser vinculado. Outros sites ainda podem vincular a uma URL desautorizada, e a URL aparecerá nos resultados de busca apenas com a URL (sem título ou descrição).
  • Impedir que a página seja renderizada. Os usuários ainda podem visitar uma URL desautorizada.
  • Ocultar a URL do mundo. robots.txt é público; listar caminhos secretos lá os divulga.

Perguntas frequentes

Porque desabilitar o bloqueio de rastreamento, não a indexação. Se o Google já conhece a URL (de links ou sitemap), pode manter a URL básica nos resultados de busca. Use uma tag noindex na página e deixe o Google buscá-la para confirmar a remoção.

Sim. Use um bloqueio User-agent: BadBot com suas próprias regras. Note que bots mal comportados ignoram completamente o robots.txt; apenas bots em conformidade o respeitam.

Não. robots.txt é público, listá-lo divulga a localização. Use autenticação e controle de acesso em nível de servidor em vez disso.

Sim, para caminhos. Disallow: /Admin/ não bloqueia /admin/. Correspondência com a capitalização real de suas URLs.

Sim. Liste várias linhas Sitemap: para apontar para sitemaps XML separados ou um índice de sitemap.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas