Extrair URLs do Texto
Cole um registro de chat, um documento markdown, uma thread de e-mail ou um despejo HTML bruto e receba uma lista limpa de todos os links http:// e https:// que ele contém. O detector remove a pontuação final, lida com a sintaxe de links markdown e HTML e elimina duplicatas exatas, para você enviar a lista direto para um rastreador ou ferramenta de arquivamento.
Como extrair URLs
-
1
Cole a fonte
Insira o texto ou HTML. Aspas, sinais de menor e maior, sintaxe de link markdown e pontuação final são tratados automaticamente.
-
2
Execute a varredura
Todos os links `http://` e `https://` são encontrados, a pontuação final é removida e duplicatas exatas são eliminadas.
-
3
Revise a contagem
Você verá quantas URLs únicas foram encontradas e a lista completa.
-
4
Copie ou exporte
Uma URL por linha, pronta para `curl -I`, um arquivador, um serviço de captura de tela ou listas de seeds do Screaming Frog.
O que conta como URL
A detecção de URLs é mais difícil do que parece, e este extrator segue deliberadamente uma regra segura: ele só captura links completos http:// e https://. Todo o resto permanece no seu texto.
Formas reconhecidas
| Forma | Exemplo |
|---|---|
| HTTPS absoluto | https://example.com/path?q=1 |
| HTTP absoluto | http://example.com |
| Destino de link markdown | [text](https://example.com) |
| href absoluto em HTML | href="https://example.com" |
Regras de corte
A pontuação final é removida, então (https://example.com). vira https://example.com. Espaços, aspas, sinais de menor e maior, parênteses, colchetes, vírgulas e ponto e vírgula interrompem a correspondência. Uma URL com parênteses é cortada no primeiro parêntese de abertura, então um título no estilo Wikipedia só é capturado até o parêntese de abertura.
O que ele ignora
mailto:,tel:,ftp:e qualquer outro esquema que não sejahttpouhttps.- Links relativos ao protocolo, como
//cdn.example.com/asset.js. - Domínios nus e endereços com prefixo
www.sem esquema, comoexample.com/docs/introouwww.example.com/page. - Fragmentos apenas de âncora, como
#section, e pseudo-URLs JavaScript.
Como as duplicatas são tratadas
Duplicatas exatas são removidas: https://example.com conta uma vez, não importa quantas vezes apareça, enquanto Example.com e example.com permanecem como entradas separadas. A lista mantém a ordem em que cada URL apareceu pela primeira vez.
Dicas de pós-processamento
- Use minúsculas para deduplicação canônica. Se
Example.comeexample.comdevem contar como um mesmo host, converta a saída para minúsculas e deduplique novamente. - Remova parâmetros de rastreamento com um limpador de UTM antes de arquivar, ou você acabará com dezenas de quase duplicatas.
- Verifique o status. Passe a lista por um verificador de links quebrados para eliminar os 404 antes de fechar a lista.
Perguntas frequentes
Somente quando o link curto é escrito com o esquema completo. bit.ly/xyz sozinho não é capturado, mas https://bit.ly/xyz é tratado como uma URL comum. O extrator não segue redirecionamentos; resolva-os separadamente se precisar do destino final.
Sim, quando o href é uma URL http:// ou https:// completa. O valor é extraído de forma limpa, sem a tag ao redor; hrefs relativos não são capturados.
Eles são mantidos como estão. Se você quiser remover utm_* e parâmetros de rastreamento semelhantes, use uma ferramenta de limpeza de URL após a extração.
Não. O texto é processado durante a solicitação e o conteúdo não é persistido nem registrado.
Ferramentas relacionadas
Contador de Palavras
Conte palavras, caracteres, frases e parágrafos com tempo de leitura, tempo de fala, densidade de palavras-chave e uma pontuação de legibilidade Flesch para redações, posts, legendas e meta descriptions.
Gerador de nomes de cidades
Gere nomes fictícios de cidades, vilas, aldeias e capitais para worldbuilding, mapas, jogos, histórias e dados fictícios, com notas curtas para cada resultado.
Símbolos de seta para copiar
Copie setas Unicode comuns em um clique: retas, duplas, diagonais, com gancho, circulares e triangulares para documentos, chats e designs.
Gerador de Texto Negrito Itálico
Transforme texto comum em caracteres Unicode negrito itálico. Pronto para colar em bios do Instagram, Twitter/X, LinkedIn e Discord onde markdown não é suportado.
Gerador de Nomes de Domínio
Gere ideias de nomes de domínio a partir de uma palavra-chave: prefixos, sufixos, letras duplicadas e finais numéricos em seis TLD comuns.
Conversor de texto amigável para dislexia
Reorganize o texto colado em parágrafos curtos e linhas de cerca de 72 caracteres para facilitar a leitura. Copie o resultado para qualquer documento, e-mail ou editor.
Ferramenta disponível em outros idiomas
- Trích xuất URL từ văn bản [VI]
- Ekstrak URL dari Teks [ID]
- ดึง URL จากข้อความ [TH]
- Extrahera URL:er från text [SV]
- Extraer URLs del Texto [ES]
- URLs aus Text extrahieren [DE]
- URL's extraheren uit tekst [NL]
- 텍스트에서 URL을 추출합니다 [KO]
- Wydobywanie URL-ów z tekstu [PL]
- Metinden URL'leri Çıkarma [TR]
- استخراج عناوين URL من النص [AR]
- Extraire des URL du texte [FR]
- テキストからURL抽出 [JA]
- 从文本中提取 URL [ZH]
- Extract URLs from Text [EN]
- Estrai URL dal testo [IT]
- Извлечение URL из текста [RU]