Gerador de Robots.txt
Defina o crawler que você quer atingir, liste os caminhos a bloquear e os a permitir, adicione um crawl-delay opcional e aponte para seu sitemap, e o gerador monta um robots.txt formatado corretamente que você pode copiar e implantar. Ele cuida do formato exato das linhas e da pontuação para que você não precise memorizar a sintaxe nem a grafia dos user-agents.
Como gerar o arquivo
-
1
Defina o user-agent
Insira o crawler ao qual as regras se aplicam, ou deixe * para atingir todos os bots.
-
2
Liste os caminhos a bloquear
Adicione os diretórios ou caminhos a bloquear, um por linha, por exemplo /admin/ ou /checkout/.
-
3
Liste os caminhos a permitir
Adicione os caminhos que devem continuar rastreáveis, um por linha, para criar exceções dentro de um Disallow mais amplo.
-
4
Adicione sitemap e crawl-delay
Declare a URL do seu sitemap e, se precisar, um crawl-delay em segundos.
-
5
Copie e implemente
Copie o arquivo gerado e coloque-o em https://seudominio.com/robots.txt, na raiz, não em um subdiretório.
Modelos iniciais típicos
Permitir tudo (a maioria dos sites):
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
Bloquear staging / admin:
User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml
Bloquear crawlers de treinamento de IA, permitir motores de busca:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
User-agents que vale a pena conhecer
| User-agent | Proprietário | Propósito |
|---|---|---|
| Googlebot | Google Search | Indexação da web |
| Googlebot-Image | Pesquisa de imagens | |
| Google-Extended | Treinamento Bard/Gemini (opt-out) | |
| Bingbot | Microsoft | Pesquisa Bing |
| DuckDuckBot | DuckDuckGo | Pesquisa DDG |
| GPTBot | OpenAI | ChatGPT / treinamento (opt-out) |
| ClaudeBot | Anthropic | Treinamento Claude (opt-out) |
| CCBot | Common Crawl | Corpus usado por muitos LLMs |
| AhrefsBot | Ahrefs | Índice de backlinks de SEO |
| SemrushBot | Semrush | Pesquisa de SEO |
| MJ12bot | Majestic | Pesquisa de SEO |
Bots de treinamento de IA são opt-out por convenção, não por exigência legal; operadores de boa-fé respeitam as diretrizes, os menos escrupulosos não o fazem.
Regras de correspondência de caminhos
- Os caminhos são relativos à raiz do domínio, começando com
/. *corresponde a qualquer caractere.Disallow: /*.pdf$bloqueia todos os PDFs.$anexa ao final da URL.Disallow: /*/trash$bloqueia/foo/trash, mas não/foo/trashes/....- O maior match vence.
Allow: /admin/public/substituiDisallow: /admin/para esse subcaminho. - Os caminhos são sensíveis a maiúsculas e minúsculas.
Coisas que o robots.txt não pode fazer
- Remover uma página do Google. Use uma tag meta
noindexna própria página. - Proteger uma URL de humanos. robots.txt é público e apenas sugestões para bots que cumprem.
- Limitar a taxa do Googlebot.
Crawl-delayé ignorado pelo Google; use o Search Console. - Bloquear bots que ignoram robots.txt. Scrapers de spam não leem o arquivo.
Lista de verificação de implantação
- Coloque em
https://seudominio.com/robots.txt, apenas na raiz. - Sirva com
Content-Type: text/plain(a maioria dos servidores faz isso automaticamente). - Tamanho: abaixo de 500 KB. O Google trunca arquivos maiores.
- Após a implantação, verifique o arquivo recuperado no Testador de robots.txt do Google Search Console.
- Ao remover um Disallow, note que a desindexação pode levar semanas.
Perguntas frequentes
Não estritamente. Sem um, os crawlers assumem “permitir tudo”. Se você tiver algo a bloquear, staging, admin, checkout, busca interna, você precisa de um.
Você pode pedir para pararem via blocos de user-agent como GPTBot, ClaudeBot, CCBot e Google-Extended. Operadores principais respeitam isso; scrapers menos escrupulosos ignoram completamente.
Crawlers são tolerantes, diretrizes desconhecidas são ignoradas. Erros sérios (HTTP 404 ou 500) são tratados como “permitir tudo”. Valide o arquivo antes de enviar.
Na raiz de cada host que você deseja cobrir, https://www.example.com/robots.txt e https://example.com/robots.txt são arquivos separados para hosts separados.
Não. Os caminhos que você insere são usados apenas para montar o arquivo; não são salvos nem registrados.
Ferramentas relacionadas
Referência da Tabela ASCII
Tabela ASCII completa de 0 a 127 com valores decimais, hexadecimais, octais e binários e notação de referência numérica HTML, incluindo NUL, LF e DEL.
Referência de Caracteres HTML
Lista pesquisável de entidades HTML, seus códigos nomeados e numéricos, e uma cópia com um clique para caracteres e símbolos especiais.
Referência de atalhos de teclado
Pesquise atalhos padrão documentados do VS Code, Chrome e Bash com GNU Readline no macOS, Windows e Linux.
Conversor de Tamanho de Arquivo
Converta entre bytes, KB, MB, GB, TB e as unidades binárias IEC (KiB, MiB, GiB, TiB), combinando decimal e binário como preferir.
Gerador de EditorConfig
Monte um .editorconfig com as suas regras de indentação, fim de linha e charset e acrescente a seção correta para cada linguagem do seu repositório: Python, Go, YAML, Makefile e mais.
Validador de Email
Valide um endereço de email: verificação de sintaxe RFC 5322, consulta de registro MX em tempo real, além de detalhes de parte local, domínio e comprimento. Nenhum email é enviado.
Ferramenta disponível em outros idiomas
- Robots.txt-generator [NL]
- Générateur de Robots.txt [FR]
- مولد ملفات robots.txt [AR]
- Generator robots.txt [PL]
- Generator Robots.txt [ID]
- Robots.txt-Generator [DE]
- Generador de Robots.txt [ES]
- เครื่องมือสร้างไฟล์ robots.txt [TH]
- Robots.txtジェネレーター [JA]
- Robots.txt-generator [SV]
- Bộ tạo file robots.txt [VI]
- Robots.txt 생성기 [KO]
- Robots.txt Generator [EN]
- Generatore di Robots.txt [IT]
- Генератор robots.txt [RU]
- Robots.txt Oluşturucu [TR]
- Robots.txt 生成器 [ZH]