Extrair URLs do Texto

Cole um registro de chat, um documento markdown, uma thread de e-mail ou um despejo HTML bruto e receba uma lista limpa de todos os links http:// e https:// que ele contém. O detector remove a pontuação final, lida com a sintaxe de links markdown e HTML e elimina duplicatas exatas, para você enviar a lista direto para um rastreador ou ferramenta de arquivamento.

Como extrair URLs

  1. 1

    Cole a fonte

    Insira o texto ou HTML. Aspas, sinais de menor e maior, sintaxe de link markdown e pontuação final são tratados automaticamente.

  2. 2

    Execute a varredura

    Todos os links `http://` e `https://` são encontrados, a pontuação final é removida e duplicatas exatas são eliminadas.

  3. 3

    Revise a contagem

    Você verá quantas URLs únicas foram encontradas e a lista completa.

  4. 4

    Copie ou exporte

    Uma URL por linha, pronta para `curl -I`, um arquivador, um serviço de captura de tela ou listas de seeds do Screaming Frog.

O que conta como URL

A detecção de URLs é mais difícil do que parece, e este extrator segue deliberadamente uma regra segura: ele só captura links completos http:// e https://. Todo o resto permanece no seu texto.

Formas reconhecidas

Forma Exemplo
HTTPS absoluto https://example.com/path?q=1
HTTP absoluto http://example.com
Destino de link markdown [text](https://example.com)
href absoluto em HTML href="https://example.com"

Regras de corte

A pontuação final é removida, então (https://example.com). vira https://example.com. Espaços, aspas, sinais de menor e maior, parênteses, colchetes, vírgulas e ponto e vírgula interrompem a correspondência. Uma URL com parênteses é cortada no primeiro parêntese de abertura, então um título no estilo Wikipedia só é capturado até o parêntese de abertura.

O que ele ignora

  • mailto:, tel:, ftp: e qualquer outro esquema que não seja http ou https.
  • Links relativos ao protocolo, como //cdn.example.com/asset.js.
  • Domínios nus e endereços com prefixo www. sem esquema, como example.com/docs/intro ou www.example.com/page.
  • Fragmentos apenas de âncora, como #section, e pseudo-URLs JavaScript.

Como as duplicatas são tratadas

Duplicatas exatas são removidas: https://example.com conta uma vez, não importa quantas vezes apareça, enquanto Example.com e example.com permanecem como entradas separadas. A lista mantém a ordem em que cada URL apareceu pela primeira vez.

Dicas de pós-processamento

  • Use minúsculas para deduplicação canônica. Se Example.com e example.com devem contar como um mesmo host, converta a saída para minúsculas e deduplique novamente.
  • Remova parâmetros de rastreamento com um limpador de UTM antes de arquivar, ou você acabará com dezenas de quase duplicatas.
  • Verifique o status. Passe a lista por um verificador de links quebrados para eliminar os 404 antes de fechar a lista.

Perguntas frequentes

Somente quando o link curto é escrito com o esquema completo. bit.ly/xyz sozinho não é capturado, mas https://bit.ly/xyz é tratado como uma URL comum. O extrator não segue redirecionamentos; resolva-os separadamente se precisar do destino final.

Sim, quando o href é uma URL http:// ou https:// completa. O valor é extraído de forma limpa, sem a tag ao redor; hrefs relativos não são capturados.

Eles são mantidos como estão. Se você quiser remover utm_* e parâmetros de rastreamento semelhantes, use uma ferramenta de limpeza de URL após a extração.

Não. O texto é processado durante a solicitação e o conteúdo não é persistido nem registrado.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas