Verificador de Robots.txt
Cole suas regras de robots.txt e o caminho de URL que você quer testar, e o verificador lê as linhas Allow e Disallow para dizer se esse caminho seria bloqueado ou permitido. Útil quando uma página some de repente do Google e você quer confirmar se um Disallow exagerado é a causa, ou quando está redigindo novas regras e quer verificar um caminho antes de publicar o arquivo.
Como o verificador funciona
-
1
Cole suas regras
Copie as linhas Allow e Disallow do seu robots.txt na caixa, ou redija novas para testá-las.
-
2
Digite um caminho para testar
Digite o caminho de URL que você quer verificar, por exemplo /private/page. Use apenas o caminho, não o domínio completo.
-
3
Verifique a regra
O verificador analisa as linhas Allow e Disallow e encontra qual corresponde ao caminho que você digitou.
-
4
Leia o veredito
Você obtém o número de regras encontradas, o caminho testado e a decisão: permitido por padrão, bloqueado por um Disallow ou permitido por um Allow.
Um robots.txt mínimo e correto
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
- User-agent: *. Aplica-se a qualquer crawler não explicitamente nomeado em outro bloco.
- Allow: /. Tudo permitido por padrão.
- Disallow: /admin/. O diretório de administração está fora dos limites.
- Sitemap:. Informa aos motores de busca onde encontrar o sitemap XML.
Regras que o Googlebot realmente segue
O parser do Google é o padrão de fato para interpretar regras ambíguas:
- Caminhos sensíveis a maiúsculas.
/Admin/e/admin/são diferentes. - O maior match vence.
Allow: /admin/public/superaDisallow: /admin/para uma URL que começa com/admin/public/. - Curingas.
*corresponde a qualquer sequência de caracteres;$ancla no final da URL. - Comentários começam com
#. - Independente de ordem. As regras são avaliadas pela especificidade (comprimento do caminho), não pela ordem de listagem.
Erros comuns
| Erro | Efeito |
|---|---|
Disallow: / no topo, sem Allow |
Site inteiro bloqueado |
Disallow: *.pdf |
Muitos parsers ignoram, use Disallow: /*.pdf$ |
| URL relativa ao protocolo ou absoluta em Disallow | Ignorado, caminhos devem ser relativos |
Múltiplas linhas User-agent antes das regras |
Combinadas; regras se aplicam a todos os UAs listados |
| Espaços em branco no final dos caminhos | Silenciosamente tratado como caminho diferente |
| Colocando robots.txt em um subdiretório | Apenas o arquivo do domínio raiz é buscado |
robots.txt vs noindex
robots.txt informa aos crawlers não buscar uma URL. Uma página que já está indexada e depois bloqueada no robots.txt pode permanecer indexada por meses, o crawler não pode buscá-la para confirmar a remoção. Se você quiser que ela saia do índice, use uma tag meta noindex ou cabeçalho HTTP na própria página e deixe o crawler vê-la.
Crawl-delay
Crawl-delay: 10 solicita 10 segundos entre as requisições. O Google ignora isso (use o Search Console para definir a taxa de rastreamento). Bing, Yandex e alguns crawlers de nicho respeitam. Use para sites pequenos sob pressão de rastreamento de bots de nicho.
O que Disallow NÃO faz
- Bloquear de ser vinculado. Outros sites ainda podem vincular a uma URL desautorizada, e a URL aparecerá nos resultados de busca apenas com a URL (sem título ou descrição).
- Impedir que a página seja renderizada. Os usuários ainda podem visitar uma URL desautorizada.
- Ocultar a URL do mundo. robots.txt é público; listar caminhos secretos lá os divulga.
Perguntas frequentes
Porque desabilitar o bloqueio de rastreamento, não a indexação. Se o Google já conhece a URL (de links ou sitemap), pode manter a URL básica nos resultados de busca. Use uma tag noindex na página e deixe o Google buscá-la para confirmar a remoção.
Sim. Use um bloqueio User-agent: BadBot com suas próprias regras. Note que bots mal comportados ignoram completamente o robots.txt; apenas bots em conformidade o respeitam.
Não. robots.txt é público, listá-lo divulga a localização. Use autenticação e controle de acesso em nível de servidor em vez disso.
Sim, para caminhos. Disallow: /Admin/ não bloqueia /admin/. Correspondência com a capitalização real de suas URLs.
Sim. Liste várias linhas Sitemap: para apontar para sitemaps XML separados ou um índice de sitemap.
Ferramentas relacionadas
Extrator de Links Internos
Extraia todos os links internos de uma URL ou HTML colado com texto âncora, atributos rel e status nofollow para auditorias de SEO.
Verificador de Comprimento de Meta Descrição
Meça uma meta descrição em caracteres e pixels estimados, compare referências editoriais e examine modelos para computador e celular.
Extrator de Links Externos
Cole um HTML bruto, defina opcionalmente uma URL base e obtenha uma lista limpa e sem duplicatas de todos os links externos http/https do código para auditorias de links e revisões de SEO.
Verificador de Hreflang
Verifique localmente anotações hreflang no HTML colado: códigos, URLs completas, duplicatas, posição e autorreferência.
Contador de frequência de palavras
Encontre as palavras mais repetidas em qualquer texto, com contagens e percentuais de densidade. Útil para revisão, SEO e auditorias de conteúdo.
Gerador de Esquema FAQ
Gere marcação JSON-LD FAQPage a partir de pares de perguntas e respostas para qualificar-se para os resultados ricos do Google e colocações em caixas de resposta.
Ferramenta disponível em outros idiomas
- Robots.txtチェッカー [JA]
- Robots.txt 검사기 [KO]
- Sprawdzanie robots.txt [PL]
- เครื่องมือตรวจสอบไฟล์ robots.txt [TH]
- Verificador de robots.txt [ES]
- Robots.txt-kontroll [SV]
- Trình kiểm tra robots.txt [VI]
- أداة فحص ملف robots.txt [AR]
- Vérificateur de Robots.txt [FR]
- Robots.txt-Prüfer [DE]
- Pemeriksa Robot.txt [ID]
- Robots.txt-checker [NL]
- Robots.txt Checker [EN]
- Controllore Robots.txt [IT]
- Проверка robots.txt [RU]
- Robots.txt Denetleyici [TR]
- Robots.txt 检查器 [ZH]