Gerador de Robots.txt

Defina o crawler que você quer atingir, liste os caminhos a bloquear e os a permitir, adicione um crawl-delay opcional e aponte para seu sitemap, e o gerador monta um robots.txt formatado corretamente que você pode copiar e implantar. Ele cuida do formato exato das linhas e da pontuação para que você não precise memorizar a sintaxe nem a grafia dos user-agents.

Como gerar o arquivo

  1. 1

    Defina o user-agent

    Insira o crawler ao qual as regras se aplicam, ou deixe * para atingir todos os bots.

  2. 2

    Liste os caminhos a bloquear

    Adicione os diretórios ou caminhos a bloquear, um por linha, por exemplo /admin/ ou /checkout/.

  3. 3

    Liste os caminhos a permitir

    Adicione os caminhos que devem continuar rastreáveis, um por linha, para criar exceções dentro de um Disallow mais amplo.

  4. 4

    Adicione sitemap e crawl-delay

    Declare a URL do seu sitemap e, se precisar, um crawl-delay em segundos.

  5. 5

    Copie e implemente

    Copie o arquivo gerado e coloque-o em https://seudominio.com/robots.txt, na raiz, não em um subdiretório.

Modelos iniciais típicos

Permitir tudo (a maioria dos sites):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

Bloquear staging / admin:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

Bloquear crawlers de treinamento de IA, permitir motores de busca:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

User-agents que vale a pena conhecer

User-agent Proprietário Propósito
Googlebot Google Search Indexação da web
Googlebot-Image Google Pesquisa de imagens
Google-Extended Google Treinamento Bard/Gemini (opt-out)
Bingbot Microsoft Pesquisa Bing
DuckDuckBot DuckDuckGo Pesquisa DDG
GPTBot OpenAI ChatGPT / treinamento (opt-out)
ClaudeBot Anthropic Treinamento Claude (opt-out)
CCBot Common Crawl Corpus usado por muitos LLMs
AhrefsBot Ahrefs Índice de backlinks de SEO
SemrushBot Semrush Pesquisa de SEO
MJ12bot Majestic Pesquisa de SEO

Bots de treinamento de IA são opt-out por convenção, não por exigência legal; operadores de boa-fé respeitam as diretrizes, os menos escrupulosos não o fazem.

Regras de correspondência de caminhos

  • Os caminhos são relativos à raiz do domínio, começando com /.
  • * corresponde a qualquer caractere. Disallow: /*.pdf$ bloqueia todos os PDFs.
  • $ anexa ao final da URL. Disallow: /*/trash$ bloqueia /foo/trash, mas não /foo/trashes/....
  • O maior match vence. Allow: /admin/public/ substitui Disallow: /admin/ para esse subcaminho.
  • Os caminhos são sensíveis a maiúsculas e minúsculas.

Coisas que o robots.txt não pode fazer

  • Remover uma página do Google. Use uma tag meta noindex na própria página.
  • Proteger uma URL de humanos. robots.txt é público e apenas sugestões para bots que cumprem.
  • Limitar a taxa do Googlebot. Crawl-delay é ignorado pelo Google; use o Search Console.
  • Bloquear bots que ignoram robots.txt. Scrapers de spam não leem o arquivo.

Lista de verificação de implantação

  1. Coloque em https://seudominio.com/robots.txt, apenas na raiz.
  2. Sirva com Content-Type: text/plain (a maioria dos servidores faz isso automaticamente).
  3. Tamanho: abaixo de 500 KB. O Google trunca arquivos maiores.
  4. Após a implantação, verifique o arquivo recuperado no Testador de robots.txt do Google Search Console.
  5. Ao remover um Disallow, note que a desindexação pode levar semanas.

Perguntas frequentes

Não estritamente. Sem um, os crawlers assumem “permitir tudo”. Se você tiver algo a bloquear, staging, admin, checkout, busca interna, você precisa de um.

Você pode pedir para pararem via blocos de user-agent como GPTBot, ClaudeBot, CCBot e Google-Extended. Operadores principais respeitam isso; scrapers menos escrupulosos ignoram completamente.

Crawlers são tolerantes, diretrizes desconhecidas são ignoradas. Erros sérios (HTTP 404 ou 500) são tratados como “permitir tudo”. Valide o arquivo antes de enviar.

Na raiz de cada host que você deseja cobrir, https://www.example.com/robots.txt e https://example.com/robots.txt são arquivos separados para hosts separados.

Não. Os caminhos que você insere são usados apenas para montar o arquivo; não são salvos nem registrados.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas