Conversor de HTML para Texto

Emails em texto simples, análises de texto e pipelines de contagem de palavras precisam que o HTML seja transformado na string legível que um humano veria, sem artefatos de marcação. Cole o HTML e esta ferramenta remove cada tag, decodifica entidades (&&), colapsa sequências de espaços criadas por indentação e produz um bloco limpo de prosa legível pronto para análise ou para a parte text/plain de um email multipart.

Como remover HTML para texto

  1. 1

    Cole o HTML

    Qualquer tamanho, um trecho, um corpo de email rico ou uma página inteira.

  2. 2

    Converter

    Um clique: cada tag e atributo é removido e as entidades são decodificadas.

  3. 3

    Revise as quebras de linha

    Parágrafos, itens de lista e linhas de tabela se tornam linhas separadas, então o texto mantém sua estrutura.

  4. 4

    Copie o texto

    A saída é texto Unicode simples, seguro para ser usado em um contador de palavras, um modelo de email ou um modelo de sentimento.

Como a conversão lida com tags complicadas

Transformar HTML em texto é mais do que string.replace(/<[^>]+>/, ""): uma expressão regular ingênua deixa os códigos de entidades e os espaços de indentação no lugar, e não sabe que </p> deveria iniciar uma nova linha.

Tags em nível de bloco vs inline

Tags em nível de bloco (<br>, e as tags de fechamento </p>, </div>, </h1> a </h6>, </li>, </tr>) produzem uma quebra de linha cada uma. Tags inline (<a>, <span>, <strong>) não deixam espaços em branco, então as palavras não se fundem.

Comportamentos específicos de tags

Tag Tratamento
<br> Uma quebra de linha
</p>, </div>, </h1> a </h6> Uma quebra de linha por tag de fechamento
</li>, </tr> Uma quebra de linha; marcadores e separadores de células não são adicionados
<a href="url">texto</a> texto; o atributo href é removido
<img alt="texto"> Nada, a tag não tem texto visível
<script>, <style> As tags são removidas, o texto entre elas é mantido

Decodificação de entidades

  • Entidades nomeadas (&amp;, &copy;, &eacute;) decodificam para seu caractere Unicode.
  • Entidades numéricas (&#169;, &#x00A9;) também são decodificadas.
  • Entidades desconhecidas são preservadas literalmente, para que ferramentas de análise as vejam.

Normalização de espaços em branco

  • Espaços e tabulações antes de uma quebra de linha são removidos.
  • Três ou mais linhas em branco seguidas são reduzidas a uma única.
  • Os espaços entre palavras são mantidos como estão; o conversor não reajusta o texto.

Usos

  • Gerar a parte text/plain de um email multipart.
  • Limpar artigos extraídos antes de passar para um modelo de linguagem.
  • Alimentar um índice de busca em texto simples.
  • Calcular uma contagem honesta de palavras que ignora a marcação.

Perguntas frequentes

A formatação visual (negrito, cor, fonte) é perdida, esse é o objetivo. A estrutura sobrevive como quebras de linha: parágrafos, itens de lista e linhas de tabela se tornam linhas separadas, então o texto permanece legível.

O texto visível do link permanece, mas a URL é removida junto com os atributos da tag. Se você precisa das URLs, use um conversor dedicado de HTML para Markdown.

O conversor remove as tags, mas mantém o texto entre elas, então o conteúdo dos blocos <script> e <style> permanece na saída. Remova-o do HTML de origem antes, se não o quiser.

Sim. A saída é UTF-8 e preserva todos os caracteres não-ASCII da entrada. Entidades como &copy; e &eacute; são decodificadas em seus equivalentes Unicode.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas