Extrator de Links Externos

Cole um HTML bruto e obtenha uma lista limpa e sem duplicatas de todos os links externos que ele contém. Opcionalmente, informe uma URL base para o extrator saber qual host conta como interno; links para qualquer outro host são listados. Útil ao auditar um site em busca de vazamentos de links, posicionamentos de parceiros desatualizados ou para confirmar que os links de saída vão para onde sua política exige.

Como extrair links externos

  1. 1

    Forneça a fonte

    Cole o HTML bruto da página. Opcionalmente, adicione uma URL base para o extrator saber qual host conta como interno; deixe vazia para tratar todos os hosts como externos.

  2. 2

    Executar a extração

    Cada `<a href>` é lido e apenas links absolutos http/https cujo host difere do host base são mantidos. Duplicatas são removidas.

  3. 3

    Revisar a lista

    Você recebe uma URL externa por linha, pronta para colar em uma planilha ou verificar links individualmente.

  4. 4

    Usar o resultado

    Copie a lista para a área de transferência ou mantenha a página aberta enquanto confere cada destino em uma nova aba.

O que o extrator considera externo

Um link é externo quando seu host difere da URL base que você informou (a comparação não diferencia maiúsculas de minúsculas). Subdomínios contam como hosts separados, então blog.example.com é externo em relação a www.example.com. Para auditorias em todo o subdomínio, remova o subdomínio da sua URL base. Deixe a URL base vazia para listar todos os links http/https como externos.

O extrator informa apenas as URLs de destino. Ele não lê o texto âncora nem os atributos rel; audite os tokens nofollow, ugc e sponsored diretamente no HTML de origem.

O que ele ignora

  • mailto:, tel:, javascript: e hrefs apenas de fragmento #.
  • URLs relativas e URLs relativas ao protocolo, como //cdn.example.com (transforme-as em URLs absolutas no HTML colado se quiser contá-las).
  • Tags âncora sem href (não são links navegáveis).

Dicas

  • Cole o HTML renderizado se a página usa JavaScript. Links que um framework gera no cliente só aparecem quando você cola o DOM renderizado (por exemplo, copie o outerHTML do DevTools).
  • Cuidado com wrappers de rastreamento. Redirecionamentos de afiliados por meio de /go/ ou /out/ podem ocultar o destino real; o extrator devolve a URL do wrapper como está, então inspecione o href bruto quando um destino parecer suspeito.
  • Normalize antes de comparar. Uma URL com fragmento ou parâmetro de rastreamento diferente conta como um link separado; normalize as URLs antes de comparar duas execuções do extrator.
  • Compare ao longo do tempo. Execute o extrator mensalmente e compare as listas; novos links externos que você não adicionou são o primeiro sinal de um tema ou plugin comprometido.

Perguntas frequentes

Ela extrai o href exatamente como escrito no HTML. Seguir cada redirecionamento atrasaria muito o relatório e pode ativar proteções contra bots no destino; resolva-os separadamente se precisar da URL final.

Não. O extrator analisa o HTML conforme entregue. Links que um framework renderiza no cliente só aparecerão se você colar o DOM renderizado (por exemplo, copie o outerHTML do DevTools).

Apenas URLs absolutas http/https são informadas. URLs relativas ao protocolo como //cdn.example.com, caminhos relativos e links mailto: ou tel: são ignorados; transforme-os em URLs absolutas no HTML colado se quiser contá-los.

O HTML que você cola é enviado ao nosso servidor apenas para executar a extração na solicitação atual. Ele não é salvo em um banco de dados nem em um log, e nada é mantido depois que a resposta chega ao seu navegador.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas